InternVL-Uは、上海AIラボをはじめとする複数の組織が開発した、オープンソースのマルチモーダル統合モデルです。
InternVL-Uは、上海人工知能研究所が複数のトップ大学と共同でオープンソース化した、4Bパラメータを持つ軽量で統一されたマルチモーダルモデルです。初めて「理解-推論-生成-編集」のエンドツーエンドのクローズドループを実現しました。このモデルは「統一されたコンテキストモデリング+モーダル...」を採用しています。
InternVL-Uは、上海人工知能研究所が複数のトップ大学と共同でオープンソース化した、4Bパラメータを持つ軽量で統一されたマルチモーダルモデルです。初めて「理解-推論-生成-編集」のエンドツーエンドのクローズドループを実現しました。このモデルは「統一されたコンテキストモデリング+モーダル...」を採用しています。
Solarisは、Minecraftにおいて2人のプレイヤーに対して一貫した一人称視点を同時に生成できる、初のマルチプレイヤービデオワールド生成モデルです。シングルプレイヤーモードのみをサポートする既存モデルの限界を克服し、プレイヤーの視点間で空間的な一貫性を確保します。
StepClawは、StepAIが開発したクラウドベースのインテリジェントアシスタントで、OpenClawアーキテクチャをベースとしています。ユーザーはStepAIアプリを通じてクラウド上にStepClawを迅速に展開できるため、ローカルハードウェアの設定の手間を省くことができます。
LTX-2.3は、イスラエルのAI企業Lightricksがオープンソース化した最新世代のビデオ生成モデルです。拡散トランスフォーマーアーキテクチャを採用し、220億個のパラメータを誇ります。このモデルは、テキスト、画像、音声の入力に対応しています。
Nemotron 3 Superは、NVIDIAが開発した1200億個のパラメータを持つオープンソースのAIモデルです。Mamba-MoEハイブリッドアーキテクチャを採用し、エージェントアプリケーション向けに最適化されています。このモデルは、最大100万トークンの超長文コンテキストをサポートし、推論速度を3倍向上させ、高いスループットを実現します。
Gemini Embedding 2は、Google初のネイティブマルチモーダル埋め込みモデルであり、Geminiアーキテクチャに基づいて構築されています。このモデルは、テキスト、画像、動画、音声、ドキュメントを統一されたベクトル空間にマッピングし、100以上の言語をサポートしています。
CLI-Anythingは、香港大学のデータサイエンス研究所(HKUDS)が開発したオープンソースツールで、あらゆるオープンソースソフトウェアのコードベースを、AIエージェントが使用できるコマンドラインインターフェース(CLI)にワンクリックで変換できます。
SongGeneration 2は、テンセントと清華大学が共同でオープンソース化した4Bパラメータの音楽生成モデルです。ハイブリッドLLM拡散アーキテクチャと階層的表現設計を採用し、商用レベルの音楽生成品質を実現しています。このモデルは、歌詞精度8.55%を達成しています。
MiroFishは、中国科学技術大学の20歳の学生であるBaiFu氏が開発した、マルチエージェント技術に基づくAI予測エンジンです。MiroFishは、現実世界のシード情報(ニュース、小説、政策など)から高精細な並行デジタル世界を自動的に構築し、…
Mobile-Agent-v3.5 は、Alibaba Tongyi Labs がオープンソース化した新世代のマルチプラットフォーム GUI エージェント フレームワークであり、オープンソース GUI エージェントが「デモンストレーション レベル」から「エンジニアリング レディ レベル」へと移行したことを示すものです。このフレームワークは、デスクトップ、モバイル、ブラウザをネイティブにサポートしています。
gws(Google Workspace CLI)は、Google Workspaceチームによって開発されたオープンソースのコマンドラインツールです。Rustで記述され、npm経由で配布されています。最大の特長は、静的なコマンドリストに依存せず、実行時にコマンドを動的に構築できることです。
HY-WU(Hun Yuan Wu Xiang)は、テンセント洛源が開発した機能的なニューラルメモリフレームワークであり、AIが推論中にリアルタイムでパーソナライズされたパラメータを生成することを可能にします。このフレームワークは、Transformerパラメータジェネレータを使用して、推論中の入力に基づいてパーソナライズされたパラメータをリアルタイムで合成します。
JadeAIは、twwchによって開発されたオープンソースのAI搭載履歴書生成ツールで、真にユーザーフレンドリーで完全無料、かつセルフホスティング可能な履歴書ソリューションとして位置づけられています。Next.jsをベースに構築され、Apache 2.0ライセンスでリリースされています。
Symphonyは、OpenAIが開発したオープンソースのエージェントオーケストレーションシステムで、プロジェクト作業を独立した自律的なタスクに変換することをサポートします。SymphonyはLinearなどのカンバンボードを監視し、コーディング、テスト、マージなどを完了するようにエージェントを自動的にスケジュールできます。
Roubaoは、ByteDanceの「Doubao Mobile Assistant」の無料代替となることを目的とした、オープンソースのAI搭載モバイル自動化アシスタントです。Roubaoはビジュアル言語モデル(VLM)に基づいており、Kotlinでネイティブに開発されているため、コンピュータやroot権限は必要ありません。
HiClawは、アリババが開発したオープンソースのエージェントベースのチームコラボレーションシステムで、「OpenClawのチーム版」として位置づけられています。このシステムは、マネージャーエージェントをAI管理者として導入し、複数のワーカーエージェントを自動的に調整して複雑なタスクを完了させます。
Yuan3.0-Ultraは、Inspur InformationのYuanLab.aiチームが開発した、1兆パラメータ規模のオープンソースのマルチモーダル基盤モデルです。総パラメータ数は1.01T、活性化パラメータ数は68.8Bです。MoEアーキテクチャを採用し、ビジュアルエンコーダとマルチモーダルアライメントモジュールを統合しています。
Heliosは、北京大学とByteDanceが共同開発した14Bパラメータのリアルタイム長尺動画生成モデルであり、単一のH100 GPU上で1分間の動画を19.5 FPSで生成することが可能です。
Phi-4-reasoning-vision-15Bは、Microsoftが開発したオープンソースの150億パラメータを持つマルチモーダル推論モデルであり、Phi-4-Reasoning言語モデルとSigLIP-2ビジュアルエンコーダーに基づいて構築されています。
MiniMax Music 2.5+は、MiniMaxが開発したAI音楽生成モデルで、純粋な音楽制作機能に特化しています。クラシックオーケストラ、エレクトロニック、アンビエントなど、多様なスタイルに対応し、瞑想、睡眠補助、ゲーム、映画など、あらゆるシーンで活用できます。
MagicAgentは、Honorと復旦大学が共同開発した基本的なインテリジェントエージェントモデルです。32Bの高密度アーキテクチャと30B-A3BのMoEアーキテクチャにより、100億パラメータ内で最高のパフォーマンスを実現します。
Gemini 3.1 Flash-Liteは、極めて高いコストパフォーマンスを重視したGoogleの軽量フラッグシップモデルです。毎秒363トークンの出力速度と100万トークンあたり0.25ドルの入力価格で、速度面ではGPT-5を大幅に上回ります。
Fun-CosyVoice 3.5は、アリババ傘下のTongyi Labsの音声チームがリリースした最新の音声生成モデルで、多言語の音色再現と洗練された表現制御に重点を置いています。このモデルの最も注目すべき革新点は、FreeStyle自然言語制御機能にあります。
FireRed-OCRは、文書構造解析のための軽量な視覚言語モデルであり、Xiaohongshuチームによってオープンソース化されました。わずか2バイトのパラメータで、権威あるOmniDocBench v1.5ベンチマークにおいて総合スコア92.94%を達成し、GPT-5.2を上回りました。