MMSkills - 上海交通大学と小紅書が共同で立ち上げた、マルチモーダルなスキルフレームワーク。
MMSkillsは、上海交通大学とXiaohongshuが共同で開発した、汎用ビジュアルエージェント向けのマルチモーダルスキルフレームワークです。プレーンテキストのステップから、テキストフロー、ランタイム状態カード、マルチビュー機能などを含む、再利用可能なスキルの拡張をサポートしています。
MMSkillsは、上海交通大学とXiaohongshuが共同で開発した、汎用ビジュアルエージェント向けのマルチモーダルスキルフレームワークです。プレーンテキストのステップから、テキストフロー、ランタイム状態カード、マルチビュー機能などを含む、再利用可能なスキルの拡張をサポートしています。
Doubao Audio Generation Model 1.0は、Volcano Engineによって開発されたエンドツーエンドのオーディオ作成モデルで、テキストまたはオーディオを参照入力としてサポートし、ターゲットオーディオを生成します。単一のプロンプトは、複数文字の対話、感情的なトーン、BGMなどで編集できます。
白川-M4は、白川智能と清華大学が共同開発した次世代医療拡張モデルです。HealthBench総合、Hard、Professionalという3つの権威ある健康ベンチマークで世界第1位を獲得し、幻覚発生率はわずか3.3%です。
JoyAI-VL-Interactionは、JD.comのJoy Future Academyが開発したオープンソースのリアルタイムビデオ視覚言語インタラクションモデルです。世界初のフルスタック・オープンソース・インタラクションモデルシステムです。
Qwen-AgentWorldは、同義千文チームが発表した初の言語世界モデルです。MCP、検索、端末、ソフトウェアエンジニアリング、Android、Web、オペレーティングシステムなど、7つのインテリジェントエージェント環境を、長い思考連鎖推論を通してシミュレートします。
Seedance 2.5は、ByteDanceの動画生成モデル「Doubao」の最新フラッグシップバージョンで、7月上旬に正式リリースされる予定です。Seedance 2.0からの大幅なアップグレードとして、このモデルは、単一セグメントのネイティブ動画など、3つの世界的なブレークスルーを実現しています。
Unlimited-OCRは、Baiduが開発したエンドツーエンドの長文文書OCRモデルです。参照スライディングウィンドウアテンション機構を用いて、デコーダのキーバリューキャッシュを線形増加から定数へと圧縮し、単一の順変換を実現します。
AudioX-Turboは、Noiz AIが香港科技大学および清華大学と共同で開発した、統合的で効率的な音声生成フレームワークです。テキスト、ビデオ、音声入力を自由に組み合わせることで、高品質な効果音や音楽の生成をサポートします。
Boogu-Image-0.1 は、Boogu チームによる統一された画像生成および編集モデルのオープンソースファミリーです。このモデルは、テキストから画像への生成、命令型画像編集、および同じアーキテクチャ内でのバイリンガル (中国語と英語) テキストレンダリングをサポートしています。このファミリーには、Base、Edit、...
Spatial-TTTは、清華大学、テンセント渾源、南洋理工大学が共同開発したストリーミング視覚空間インテリジェンスフレームワークです。このフレームワークは20億個のパラメータしか持たず、テストタイムトレーニング(TTT)技術を用いてビデオストリーミング中にユーザーをトレーニングします。
Seed 2.1は、ByteDanceのSeedチームが開発した、現実世界の生産性向上シナリオ向けに開発された新しいインテリジェントエージェントモデルシリーズで、ProバージョンとTurboバージョンが含まれています。
VidMuseは、Sand.aiが開発したAI音楽・動画エージェントです。ユーザーはSunoリンクまたはMP3ファイルをアップロードするだけで、30~60秒のミュージックビデオを自動生成できます。VidMuse 2.0は、Video as Codeのコンセプトに基づいています。
HappyHorse 1.1は、アリババのAI動画生成モデルの最新アップグレード版であり、バージョン1.0と比較して、動的な表現力、被写体の一貫性、指示への準拠、映像品質、音声機能の5つの側面で体系的なアップグレードを実現しています。
Skill Zooは、コーディングエージェント向けのオールインワンデスクトップスキル管理ツールです。このツールはSSOT+シンボリックリンクアーキテクチャを採用し、Claude Code、Codex、Trae CN、Hermesなどのプログラミングツールに分散しているスキルを統一的に管理します。
Cowartは、Doubao DesktopのプロダクトマネージャーであるZhong Erxin氏によって開発された、OpenAI Codex用のオープンソースプラグインです。tldrawフレームワークをベースに構築されたローカルの無限キャンバスツールで、Codexからローカルの電子ホワイトボードに画像を配置することができます。
Xiaomi Miloco 2.0は、XiaomiがMiMo-V2.5-Pro大型モデルをベースに開発したオープンソースのスマートホームAIソリューションです。OpenClawを介してエージェントとして接続し、マルチモーダルな知覚、プロアクティブなインテリジェンス、継続的なタスク管理などを実現します。
Sakana Fuguは、Sakana AIが開発したマルチエージェントオーケストレーションシステムで、単一のAPIを使用してパフォーマンスの高いモデルを動的にスケジュールします。このシステムは、思考者、実行者、検証者の役割を割り当て、事前定義されたワークフローを必要とせずに、選択、委任、合成を自動的に完了します。
SpatialClawは、NVIDIA ResearchとKAISTが共同開発した、学習不要の空間推論フレームワークです。コード・アズ・アクションのメカニズムを用いて、永続的なPythonカーネル内で複雑な3D/4D空間推論タスクを繰り返し実行します。(最後の文は不完全で、おそらく別の無関係な点を指していると思われます。)
MaineCoonは、ソーシャルインタラクションシナリオに最適化された、世界初のリアルタイムオーディオおよびビデオ自己回帰型ワールドモデルです。このモデルは220億個のパラメータを持ち、単一のGPUで47.5 FPSのリアルタイムストリーミング生成を実現し、1秒未満のインタラクティブな応答をサポートします。
LOGOS(Language Of Generative Objects in Science)は、アリババ傘下のATH-Token Foundryが中国人民大学ヒルハウス人工知能研究所と共同でオープンソース化した、初の統一科学文法およびマルチドメイン科学生成基盤です。
EchoBirdは、TauriとRustを使用して開発されたオープンソースのAIエージェントデスクトップ管理ツールです。このツールは、Model Nexusプラットフォームを介して、Claude Code、Codex、OpenClawなど12種類以上のエージェントを統合します。
Grok Imagine Video 1.5は、xAIが開発したグラフベースのビデオモデルで、Aurora自己回帰エンジンをベースに構築されています。このモデルは、静的グラフからネイティブ同期オーディオ付きのショートビデオをワンクリックで生成でき、最大720pの解像度などに対応しています。
AgentCanvasは、Vstormが提供するオープンソースのPydantic AI可視化ツールです。Logfireトラッキングと統合されたAIエージェントの実行時ログを自動的にインタラクティブなHTMLフローチャートレポートに変換し、各ステップを明確に表示します。
ACE-Egoは、DaXiao Roboticsが香港中文大学のMMLabと共同開発した、オープンソースの脳ベースのマルチモルフィック身体操作(VLA)モデルです。このモデルは、6,000時間以上の人間の一人称視点ビデオを使用して事前学習されており、カメラ空間の動きと形態学的条件を組み込んでいます。