JoyAI-Video-Edit - JD.comのオープンソースリアルタイムストリーミングビデオ編集モデル
JoyAI-Video-Editは、JD.comが開発しオープンソース化したリアルタイムストリーミングビデオ編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャに基づいており、720P解像度で30FPSの推論速度を実現し、あらゆる長さのストリーミング編集を安定してサポートします。
JoyAI-Video-Editは、JD.comが開発しオープンソース化したリアルタイムストリーミングビデオ編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャに基づいており、720P解像度で30FPSの推論速度を実現し、あらゆる長さのストリーミング編集を安定してサポートします。
SeedRealtimeは、ByteDanceのSeedチームが開発したネイティブな全二重音声・動画モデルです。統一されたアーキテクチャに基づき、音声、動画、テキストをネイティブに統合することで、リアルタイムのマルチモーダルなインタラクションを実現し、ユーザーは同時に視聴、聴取、発話を行うことができます。
MAGI-2-previewは、Sand.aiのオープンソースMoEマルチモーダルビデオ生成モデルで、パラメータの総数は114バイト、アクティベーションはわずか6バイトです。このモデルはシングルストリームアーキテクチャを継承し、テキスト、ビデオ、オーディオを単一のTに統合します。
Shieldstralは、Mistral AIが開発し、Ministral-3Bを基盤とした、3Bパラメータを持つオープンソースのマルチモーダルコンテンツセキュリティ分類モデルです。このモデルは、従来の固定カテゴリのコンテンツモデレーションを、二値的な質問応答タスクとして再定義します。
MemHarnessは、上海AIラボが浙江大学、復旦大学、上海交通大学などの大学と共同で開発したLLMエージェントの記憶再構築フレームワークです。既存の記憶強化エージェントは、多くの場合、過去の経験を直接コンテキストに注入しますが、古い経験が...
Hy ASR 3.0プレビューは、テンセント渾源が発表した次世代音声認識モデルです。Hy3大規模言語モデルをベースに、高精度音声認識と高度な意味理解を統合しています。このモデルは、北京語、英語、広東語、および10の主要方言地域に対応しています。
Orchardは、Microsoft Researchが開発したオープンソースのエージェント型AIモデリングフレームワークです。その中核となるのはKubernetesベースのOrchard Environmentサービスで、データ抽出や強化学習の展開など、ドメインを跨いだサンドボックスの再利用をサポートしています。
ForgeStencilは、Wallfacer IntelligenceとOpenBMBオープンソースコミュニティが共同開発した、自動化されたステンシル研究と展開をサポートする世界初のAI最適化システムです。カーネルエージェントとアプリケーションエージェントからなるデュアルエージェント閉ループアーキテクチャに基づいています。
E-Benchは、テンセントの渾源チームが清華大学AIRおよび東南大学と共同で開発した、多段階のツール使用評価ベンチマークです。Honor of Kings、QQ Music、Tencent Meetingという3つの実在製品を基に、完全に合成された仮想環境を構築しています。
SenseNova U1.5-Lite-Previewは、SenseTimeがオープンソース化した軽量なネイティブ統合マルチモーダルモデルプレビュー版です。NEO-Unifyアーキテクチャの改良版に基づいており、8B-MoTパラメータのみを使用して、視覚的理解、推論、生成、編集を統合しています。
MindMemOSは、Huawei Noah's Ark Labsが開発したオープンソースのAIエージェント向けメモリオペレーティングシステムで、エージェントが使用後に記憶を忘れてしまうという課題を解決するために設計されています。このシステムは、個々のエージェントからメモリを分離し、フレームワーク間で再利用可能な独立したアセットとして提供します。
Qwen 3.8-Maxは、Alibaba Cloud Qwenチームが発表したフラッグシップ大規模モデルであり、総パラメータ数は2.4兆個です。Qwen 3.5アーキテクチャの拡張版であり、Qwenファミリーの中で現時点で最も強力なモデルとして、初めてオープンソース化されました。
FeyNoBgは、Feyn Labsが開発したオープンソースの自動背景除去モデルです。BiRefNetアーキテクチャをベースに大幅な改良が加えられており、2億6300万個のパラメータを誇ります。このモデルは、UHRSD-TEやHRSOD-TEを含む8つのベンチマークテストのうち4つで優れた結果を達成しました。
Qwen-Audio-3.0-ASR-Flashは、アリババのQianwenチームが開発した大規模音声認識モデルです。現在、アリババクラウドのBailianプラットフォームを通じて利用可能で、Flash、Filetrans、Streamingの3つのバージョンが提供されています。
MiniMax H3は、Xiyu Technologyが開発した汎用マルチモーダル生成モデルです。従来のタスクやモーダルの境界を打ち破り、テキスト、画像、動画、音声の統一的な理解とネイティブ生成をサポートします。このモデルは、ネイティブのデュアルチャンネル音声と動画を出力できます。
Codex Security CLIは、OpenAIが開発したオープンソースのAIコードセキュリティスキャンCLIツールで、以前はCodexに組み込まれたクローズドソースのセキュリティプラグインでした。このツールは、大規模モデルによる意味理解に基づいてコードの脆弱性を自動的にスキャンし、攻撃経路の正当性を詳細に検証します。
AngelSpecは、TencentのHunyuanチームが開発したオープンソースのエンドツーエンド投機的デコーディング学習フレームワークです。TorchSpecをベースに構築されており、MTP自己回帰やDFlyブロック並列処理を含む6つのドラフトアーキテクチャをサポートしています。推論と学習は分離されており、推論エンジンは...
Grok Voice Think Fast 2.0は、SpaceXAI(xAI)が開発したエンドツーエンドの音声間通信モデルです。ネイティブな音声間通信アーキテクチャを採用しており、認識、推論、合成といった多段階のプロセスを経ることなく、音声を直接理解して応答します。
Qwen-Audio-Agentは、アリババの音声AIチームが開発したオープンソースのリアルタイム音声エージェントフレームワークで、Qwen-Audio-3.0-Realtimeモデルをベースに構築されています。このフレームワークは、統一されたリアルタイム音声入力レイヤーとして機能し、ユーザーが自然言語処理を通じてシステムと対話することを可能にします。
Metasequoia Input Methodは、WindowsネイティブのTSFフレームワークに基づいた、無料のオープンソース中国語入力メソッドで、特にWin10/Win11向けに設計されています。ほとんどのRIMEベースのソリューションとは異なり、このツールは完全に独自開発されており、UWPおよび高解像度ディスプレイとネイティブに互換性があります。
PerceptionBenchは、Dark Side of the Moonが開発したオープンソースの視覚認識診断ベンチマークです。PerceptionBenchは、既存の42の評価セットにおける最先端モデルの失敗事例から10個の基本的な視覚認識能力を要約し、3.0...を構築します。
Instella-MoEは、AMDが開発したオープンソースのハイブリッドエキスパート言語モデルシリーズで、合計160億のパラメータ、28億のアクティベーションパラメータ、27層のデコーダアーキテクチャを備えています。このモデルは、AMD Instinct MI300X/MI325X GPUとR...に基づいています。
JiuwenSwarmは、ファーウェイの2012 Labs、Huawei Cloud、およびXiaoyi(モバイルAIアシスタント)が共同で構築したオープンソースのAIエージェントプラットフォームであり、HarmonyOS PC向けの初のオープンソース統合AIワークベンチです。このプラットフォームはマルチエージェント協調アーキテクチャを採用し、…をサポートしています。
LLaDA2.2-flashは、InclusionAIが開発したオープンソースの拡散言語モデル(dLLM)で、約100バイトのパラメータと128Kコンテキストのネイティブサポートを備えたMoEアーキテクチャを採用しています。このモデルは、マルチラウンド並列ノイズ除去によって回答を適合させ、Levinsteinアルゴリズムを組み込んでいます。