FantasyWorld - Amapと北京郵電大学が共同で立ち上げた3D世界モデリングフレームワーク
FantasyWorldは、AMAP(Amap)と北京郵電大学が共同開発した革新的な3Dワールドモデリングフレームワークです。統一されたビデオと3D予測を通じて高品質な3Dシーンを生成することに重点を置いています。このフレームワークは、静止画をベースとして使用します...
FantasyWorldは、AMAP(Amap)と北京郵電大学が共同開発した革新的な3Dワールドモデリングフレームワークです。統一されたビデオと3D予測を通じて高品質な3Dシーンを生成することに重点を置いています。このフレームワークは、静止画をベースとして使用します...
Qwen3-VL-Embeddingは、アリババ同義が発表したマルチモーダル情報検索モデルで、テキスト、画像、ビジュアルドキュメント、ビデオなどのマルチモーダル入力を処理するために特別に設計されています。強力なQwen3-VLアーキテクチャに基づいて、このモデルは…
Qwen3-VL-Rerankerは、Alibaba TongyiがQwen3-VLをベースに構築した、マルチモーダル情報検索に特化したクロスモーダル理解モデルです。このモデルは、任意のモーダル組み合わせ(例えば、テキストと画像のクエリをテキストと文書のペアでマッチングするなど)を持つクエリと文書のペアを受け入れます。
VoiceSculptorは、西北工業大学、YTO Intelligenceなどの機関が共同開発した音声設計モデルです。自然言語コマンドを通して、音声合成をきめ細かく制御することができます。
ChatDev 2.0は、清華大学、上海交通大学、OpenBMB、Wallfacer Intelligenceの共同チームによってオープンソース化された、ノーコードのマルチエージェントツールです。このツールはビジュアルインターフェースを採用しており、ドラッグ&ドロップによる設定でマルチエージェントシステムを迅速に構築できます。
EvoCUA(Evolving Computer Use Agent)は、Meituanが開発したオープンソースのマルチモーダルモデルで、コンピュータ使用タスクの自動化に重点を置いています。EvoCUAは、自然言語コマンドとスクリーンショットを使用して、Chrome、Excel、PowerPointなどのタスクを自動化します。
MMSI-Video-Benchは、ビデオ空間インテリジェンスにおけるマルチモーダル大規模言語モデル(MLLM)の能力を評価するためのベンチマークツールです。上海人工知能研究所と複数の大学が共同開発したこのツールは、現実世界のシナリオにおけるモデルを包括的に評価します。
Youtu-LLMは、テンセントのYoutuチームがオープンソース化した軽量言語モデルで、19億6000万個のパラメータを備えています。エージェントタスク向けに特化して設計されており、強力な「ネイティブエージェント機能」を備え、複数のタスクにおいて、同規模またはそれ以上の規模のモデルを凌駕する性能を発揮します。
OS-Copilotは、ネットワーク、コード端末、ファイル、マルチメディア、サードパーティ製アプリケーションなど、オペレーティングシステム内のさまざまな要素と対話できる汎用コンピュータインテリジェントエージェントの構築を目的としたオープンソースのオペレーティングシステムインテリジェントアシスタントプロジェクトです。その中核はFRIです。
Gen Robot.AIチームがオープンソース化した10Kh RealOmni-Openデータセットは、業界最大規模のオープンソースデータセットの一つです。10,000時間以上のデータ、100万以上のタスククリップ、そして合計ストレージ容量を備えています。
UI-TARS Desktopは、ByteDanceが開発したオープンソースのデスクトップ自動化ツールで、ビジュアル言語モデルに基づいています。ファイルのオープン、ウェブページの閲覧、ソフトウェアの操作など、自然言語コマンドによるコンピュータ操作の制御をサポートし、画面入力の正確な認識が可能です。
Open Interpreterは、大規模言語モデル(LLM)のネイティブコード実行機能を提供するオープンソースのAIエンドポイントアシスタントプロジェクトです。自然言語インターフェースを通じて、ユーザーはエンドポイント内でChatGPTと同様の方法で操作できます。
TeleChat3は、中国電信傘下の通信人工知能研究所(TeleAI)が独自開発した、数百億のパラメータを持つきめ細かいMoEセマンティックモデルです。国内で生産されたコンピューティングパワーを用いて学習され、複数ターン対話、テキスト生成、コード生成などのタスクをサポートします。モデルパッケージは…
openPangu-VL-7Bは、ファーウェイが開発したオープンソースのマルチモーダルモデルで、Ascendハードウェア向けに最適化されています。言語機能と画像認識機能を組み合わせたこのモデルは、強力な画像位置特定機能とOCR機能を備えており、画像、文書、動画などの処理を効率的に行うことができます。
MiroThinker v1.5は、MiroMindチームが開発したオープンソースの探索エージェントモデルです。インタラクティブな拡張技術により、推論と外部環境を密接に連携させることで、膨大なパラメータに依存する従来の大型モデルの限界を克服しています。
TuriX-CUAは、PythonをベースとしたオープンソースのAIエージェントで、AI技術を用いてデスクトップ操作を自動化します。TuriX-CUAはスクリーンショットを撮ることで画面を「認識」し、マルチモーダルな大規模モデルを用いて次のアクションを「思考」し、ユーザーの指示に従ってタスクを実行します。
DLCM(Dynamic Large Concept Models)は、ByteDance Seedチームが発表した新しい大規模言語モデルアーキテクチャです。このフレームワークは、モデルの推論単位を従来のトークン(単語)レベルから概念(コンセプト)レベルへと引き上げ、…
Paper2Anyは、北京大学DCAI研究グループが開発したオープンソースのマルチモーダルAI支援プラットフォームです。自動データガバナンスエージェントフレームワークであるDataFlow-Agentをベースとしており、研究論文を編集可能なPPTファイルとSVGファイルに自動的に変換できます。
OpenCodeは、開発効率とコード品質を向上させるオープンソースのAIプログラミングアシスタントです。このツールは、ターミナルインターフェース、デスクトップアプリケーション、またはIDEプラグインとして存在し、さまざまな言語モデル(LLM)プロバイダーと統合して開発を支援します。
StoryMemは、ByteDanceと南洋理工大学が共同でリリースしたオープンソースの動画生成フレームワークで、AI動画生成におけるショット間の一貫性という長年の課題に取り組んでいます。明示的な視覚記憶メカニズムを利用して、単一ショットの動画を拡散します。
Voquillは、従来のキーボード入力を音声入力に置き換えるオープンソースの音声入力ツールで、文章作成やメモ取りの効率を向上させます。macOS、Windows、Linuxシステムに対応しており、あらゆるテキストボックスやアプリケーションで使用できるため、…
XVERSE-Entは、Yuanxiang Technologyがエンターテインメント業界全体向けに特別に設計した、オープンソースのバイリンガル(中国語と英語)大規模モデルです。中国語モデルXVERSE-Ent-A4.2Bと英語モデルXVERSE-Ent-A5.7Bが含まれています。これらのモデルは、キャラクターの一貫性や長編ストーリーなどを重視しています。
Vibe Kanbanは、Claude Code、Gemini CLI、CodexなどのAIコーディングエージェントを効率的に管理するのに役立つオープンソースのカンバンツールです。視覚的なカンバンボードを通して、ユーザーは複数のコーディングエージェントを簡単に切り替え、連携させることができます。
ClipSketch AIは、動画クリエイター、ソーシャルメディア運営者、コンテンツクリエイター向けに設計された、オープンソースのAI駆動型コンテンツ作成ツールです。BilibiliやXiaohongshuの動画リンクを解析し、キーフレームを自動的に抽出し、変換することができます。