project
MiMo-V2.5 - Xiaomiのオールモーダルエージェント大型モデルシリーズ
MiMo-V2.5は、Xiaomiの大型モデルチームが発売した新世代のフルモーダルAgent大型モデルシリーズで、V2.5、V2.5-Pro、V2.5-TTS、V2.5-ASRの4つのバージョンがあります。
MiMo-V2.5とは何ですか?
MiMo-V2.5は、Xiaomiの大規模モデル開発チームが開発した新世代のマルチモーダルエージェントモデルで、V2.5、V2.5-Pro、V2.5-TTS、V2.5-ASRの4つのバージョンがあります。MiMo-V2.5はネイティブのマルチモーダルエージェントで、画像、音声、動画の理解と動作をサポートし、コンテキストサイズは最大1MBです。MiMo-V2.5-Proは、長期にわたる複雑なタスク向けに設計されており、ツール呼び出しを1000回近く安定して実行できます。ソフトウェアエンジニアリング能力の面では、トークン効率が42%~50%向上し、Claude Opus 4.6やGPT-5.4に匹敵します。MiMo-V2.5モデルシリーズ全体は、まもなくオープンソース化される予定です。
MiMo-V2.5の主な機能
-
MiMo-V2.5
-
ネイティブフルモーダルエージェント同時視聴、同時聴取、同時読解をサポートし、理解を行動へと転換させ、画像、音声、動画のマルチモーダルな知覚を網羅する。
-
総代理店シナリオ単純なものから中程度の複雑さの日常業務まで処理でき、APIコストは前世代と比較して約50%削減されています。
-
マルチモーダル知覚の向上そのクロスモーダル推論、ビデオ理解、グラフ分析機能は、前身のMiMo-V2-Omniを凌駕しており、VideoMME、CharXiv、MMMU-Proなどのベンチマークにおいて、トップレベルのクローズドソースモデルに匹敵する性能を発揮している。
MiMo-V2.5-Pro-
長期にわたる複雑なタスクプロフェッショナルレベルの単一のタスクにおいて、ほぼ1000回ものツール呼び出しを確実に完了させることができ、コマンドの遵守率とあいまいなコマンドの理解度が大幅に向上しています。
-
複雑なソフトウェアエンジニアリング大規模なコードベース開発、多言語プログラミング、コードデバッグ、パフォーマンス最適化をサポートし、コンパイラやビデオエディタなどのプロジェクトを単独で提供できます。
-
自律的なプロジェクト遂行RustでSysYコンパイラをゼロから完全に実装する(4.3時間、672回の呼び出し、非公開テストセットで233/233の満点)。簡単な指示のみで動作するマルチトラックビデオエディタWebアプリケーションを構築する(8,192行のコード、1,868回の呼び出し、11.5時間で完了)。
音声機能-
V2.5-TTSシリーズ音声合成の自然さ、および複数の言語・方言・音声への対応が大幅に向上しました。
-
V2.5-ASR音声認識の精度とリアルタイム性能が向上し、複数の言語と方言に対応しました。
-
MiMo-V2.5の使い方
- ウェブベースの体験MiMo Studioの公式サイトにアクセスし、登録してログインした後、MiMo-V2.5モデルを選択して会話を開始してください。
- API開発と統合開発者アカウントの登録、アプリケーションの作成、APIキーの取得を行うには、APIオープンプラットフォーム(https://platform.xiaomimimo.com/#/token-plan)にアクセスしてください。
MiMo-V2.5の主要情報と使用要件
- アクセス方法
-
MiMoスタジオ体験:https://aistudio.xiaomimimo.com
-
API呼び出し:https://platform.xiaomimimo.com
-
-
オープンソースプロジェクトMiMo-V2.5-ProとMiMo-V2.5は、まもなく世界中でオープンソース化される予定です。
- 価格設定と請求
-
MiMo-V2.5:1x Credits(1 Token = 1 Credit)
-
MiMo-V2.5-Pro:2x Credits(1 Token = 2 Credits)
-
- コンテキストウィンドウシリーズ全体を通して、100万トークン(約75万語)という超長文のコンテキストに対応しており、長文ドキュメントの分析に追加料金は発生しなくなりました。
MiMo-V2.5の主な利点
- トークン効率革命ClawEvalベンチマークで同じスコアを達成した場合、V2.5-ProはKimi K2.6と比較してトークンを42%節約し、V2.5はMuse Sparkと比較してトークンを50%節約するため、大規模展開のコストを大幅に削減できます。
- 長期的なタスクの安定性適切なランタイムフレームワークと組み合わせることで、1回のセッションで1000回近くのツール呼び出しを含む長時間のタスクを安定して完了させることができ、極めて長期間にわたって論理的な一貫性と自己修正を維持できます(例えば、コンパイラタスクにおける512回目のリファクタリング後の自己診断と回復など)。
- フルモーダルネイティブ融合テキスト、画像、音声、動画の機能が単一のモデルに統合されているため、マルチモーダルモデルとテキストモデルを切り替える必要がなくなります。
- 推論速度V2.5の平均推論速度は100~150トークン/秒ですが、V2.5-Proは60~80トークン/秒です。基本バージョンは、レイテンシに敏感なシナリオに適しています。
MiMo-V2.5プロジェクトのアドレス
- プロジェクト公式サイト:https://platform.xiaomimimo.com/docs/news/v2.5-news
MiMo-V2.5と類似の競合製品との比較
| 寸法 | MiMo-V2.5-Pro | Claude Opus 4.6 | GPT-5.4 | Kimi K2.6 |
|---|---|---|---|---|
| 位置 | 長距離エージェント/複雑なソフトウェアエンジニアリング | 最高レベルの推論とエージェント | ユニバーサルマルチモーダルフラッグシップ | オープンソースのマルチモーダルエージェント |
| SWE-bench Pro | 57.2% | リードする | リードする | — |
| MiMo Coding Bench | 73.7 | 77.1 | — | — |
| トークン効率(ClawEval) | Kimi K2.6と比較して42%節約 | — | — | ベンチマーク |
| コンテキストウィンドウ | 1M | 200K | 1M | 1M |
| すべてのモードをネイティブでサポート | Pro版はテキストとコードに対応しており、V2.5ではすべてのモードに対応しています。 | サポート | サポート | サポート |
| オープンソースプロジェクト | まもなくオープンソース化 | 非公開ソース | 非公開ソース | オープンソース |
| 価格(100万トークンあたり) | 入力1ドル/出力3ドル | より高い | より高い | — |
MiMo-V2.5の応用シナリオ
-
複雑なソフトウェア開発コンパイラ、ビデオエディタ、Webアプリケーションなどの大規模なエンジニアリングプロジェクトをゼロから独立して構築およびデバッグすることができ、人間の専門家の作業を数日から数週間分代替できる。
-
マルチモーダルコンテンツ分析冷蔵庫の写真をアップロードしてレシピの提案を受けたり、ビデオチュートリアルを分析して手順の要約を生成したり、会議を録画してToDoリストを抽出したりできます。
-
科学技術自動化アナログ回路のEDA設計、性能最適化、学術文献の長期分析、および文書間推論。
-
インテリジェントな顧客サービスとインタラクション車載システム、スマートホームシステム、および音声+画像+テキストのフルモーダル知覚に基づくリアルタイムインタラクティブシステム。
-
エンタープライズレベルのエージェント展開大規模なAPI呼び出しシナリオでは、トークン効率の高さにより、コスト管理可能な自動化ワークフローが可能になります。