Gemini 3.5 Flash-Lite - Googleがリリースした軽量AIモデル。
Gemini 3.5 Flash-Liteは、GoogleのGemini 3.5シリーズの中で最も高速かつ安価なモデルであり、高スループットかつ低遅延のプロダクショングレードのエージェントワークフロー向けに設計されています。
Gemini 3.5 Flash-Liteは、GoogleのGemini 3.5シリーズの中で最も高速かつ安価なモデルであり、高スループットかつ低遅延のプロダクショングレードのエージェントワークフロー向けに設計されています。
Gemini 3.5 Flash Cyberは、GoogleがGemini 3.5 Flashをベースに最適化した専用のサイバーセキュリティモデルです。CodeMenderコードセキュリティエージェントと連携して使用され、脆弱性の発見と修復に特化しています。
Qwen-Image-3.0は、アリババ同義千文チームが開発した第3世代の画像生成モデルです。このモデルは、最大4,500トークンの超長文入力に対応し、複雑な9グリッドの知識グラフを一度にレンダリングできます。また、10ピクセルの小さなテキストの正確な組版にも対応しています。
Audio-Visual Flamingo(略称AV-Flamingo)は、NVIDIAとメリーランド大学が共同開発したオープンソースのオーディオビジュアル大規模言語モデルです。特に、長尺動画や複雑な実世界のオーディオビジュアルコンテンツの共同理解と推論を目的として設計されています。
Hyra(Hunyuan Research Agent)は、Tencent Hunyuanが開発した再帰的で自己改善型の研究エージェントです。最初のバージョンであるHyra-1.0が正式にリリースされました。Hyraは軽量なHarnessフレームワークを使用し、Context Agentを活用しています。
AskXiaoBai 5 Proは、YuanShi Technologyが開発した新世代の長文コンテンツ生成エンジンです。YuanShiが独自開発した大型モデルとDeepSeek-R1 671Bのフルバージョンをベースに構築されており、長文コンテンツ、安定性、検索性という3つの主要機能に重点を置いています。
MiniCPM-Robotは、Wallfacer Intelligence社が提供する軽量の組み込み型インテリジェンス(VLA)モデルシリーズで、15億個のパラメータを持つ汎用操作モデルMiniCPM-RobotManipと、9億個のパラメータを持つ追跡・ナビゲーションモデルMiniCPM-RobotTrackが含まれています。
Qwen-Audio-3.0-TTSは、アリババ傘下の同義千文が開発した大規模音声合成モデルで、リアルタイム対話向けのFlash版と、高品質な音声生成を実現するPlus版が用意されています。
LoHoSearchは、MeituanのLongCatチームが開発した次世代検索インテリジェンスベンチマークです。762万件のWikipediaエンティティと2億6500万件の関係エッジを網羅するナレッジグラフに基づいて質問を自動的に生成し、従来の手動による質問生成に取って代わります。
Vivago R1は、Zhixiang Futureが開発した世界初の無制限時間マルチモーダルクリエイティブインテリジェントエージェントです。独自開発のHD-AgentOSをベースとし、マルチエージェント協調スケジューリングを実現し、あらゆる長さの動画の連続生成と編集をサポートし、長時間タスク処理能力を備えています。
Matrix-Game 3.5は、Kunlun Wanwei Riemann Powerチームが開発したオープンソースのリアルタイムストリーミング型インタラクティブワールドモデルです。Patch MemoryとWarped ProPEに基づき、3次元空間長期記憶と幾何学的整合性モデリングを実現しています。
Tempolor v4.7は、Quwan Technologyが発売したフラッグシップAI音楽生成モデルです。第4世代の階層型プログレッシブアーキテクチャを採用し、48kHzデュアルチャンネルの高音質出力に対応しています。
Qwen3.8-Max-Previewは、アリババ傘下の同義千文が発表した最新世代の基本モデルのプレビュー版で、2.4T個のパラメータを備えています。Qoder、Token Plan、QoderWorkプラットフォームで既に公開されています。
MuScriptorは、KyutaiとMireloが共同開発したオープンソースのマルチ楽器音楽文字起こしモデルで、様々なジャンルの実際の音楽オーディオを自動的にMIDIに変換することができます。
StaffDeckは、Facewall Intelligenceがノースイースタン大学-Facewall Intelligenceデータインテリジェンス共同研究所、清華大学THUNLP研究所、OpenBMB、およびAI9Starsと共同で開発した、オープンソースのデジタル従業員エンドツーエンドワークフロー構築・管理プラットフォームです。
Wan-Streamer v0.2 は、アリババの Tongyi Lab が開発した、リアルタイム双方向インタラクションのためのエンドツーエンドのフルモーダル理解および生成モデルです。このモデルは、「聞く、見る、話す、行動する」を単一の Transformer に統合し、テキスト、音声、音声などをネイティブにサポートしています。
Kimi K3は、Dark Side of the Moonが開発した、2.8兆個のパラメータを持つオープンソースモデルです。KDAハイブリッド線形アテンションメカニズムとアテンション残差技術に基づいて構築されており、視覚理解をネイティブにサポートし、100万トークンのコンテキストウィンドウを備えています。
Inklingは、Thinking Machines Labが開発した、オープンウェイト方式のマルチモーダル基盤モデルです。このモデルは、テキスト、画像、音声入力をネイティブにサポートし、ハイブリッドエキスパートアーキテクチャを採用し、410億個のアクティベーションパラメータを用いてクロスモーダル推論を実現します。
Colibrìは、オープンソースの軽量ローカル推論エンジンであり、25GBのRAMを搭載した一般消費者向けコンピュータ上で、744個のパラメータを持つ主力モデルであるGLM-5.2 MoEを実行できます。このモデルは、階層型ストレージアーキテクチャを使用して、常駐パラメータをメモリに保持します。
Xiaomi-Robotics-U0は、Xiaomiが発表した380億個のパラメータを持つ統合型具現化合成モデルです。世界ベースのモデルに基づいて継続的に学習され、テキストから画像への変換、画像編集、具現化されたシーン生成、具現化された転送、具現化されたビデオ生成などを共同で最適化します。
X2.0は、Xmax AIが開発した世界初のリアルタイムインタラクティブ動画生成モデルで、ミリ秒単位のストリーミング生成に対応しています。ユーザーはカメラを使ってキャラクターの衣装を変更したり、仮想オブジェクトを召喚したり、画面をリアルタイムで操作したりすることができ、プレイ可能な動画体験を実現します。
Qwen-Audio-3.0-Realtimeは、Alibaba Tongyiチームが開発したリアルタイム音声対話モデルで、Plus版とFlash版の両方を提供しています。このモデルは、高い推論深度を維持しながらミリ秒レベルの応答時間を実現し、インストラクショナルエージェントをサポートします。
ABot-World Studioは、AutoNaviが開発した汎用ワールドモデルワークショップで、インタラクティブなビデオ生成と3DGSシーン生成を単一の製品に統合しています。ユーザーはテキストや画像を入力して、リアルタイムでインタラクト可能なAIワールドを生成できます。
OvisOCR2は、アリババのATH-MaaSチームが開発したエンドツーエンドの文書解析モデルです。Qwen3.5-0.8Bで学習されており、完全にオープンソースです。このモデルはOmniDocBench v1.6ベンチマークで96.58のスコアを獲得し、その優れた能力を実証しました。