project
Xiaomi MiMo-V2-Omni - Xiaomiのオールモーダルエージェントベースモデル
Xiaomi MiMo-V2-Omniは、Xiaomiが発表したマルチモーダルエージェントの基本モデルであり、テキスト、画像、音声のモダリティを統合し、知覚、推論、実行機能をネイティブに備えている。
Xiaomi MiMo-V2-Omniとは何ですか?
Xiaomi MiMo-V2-Omniは、Xiaomiが発表したマルチモーダルエージェント基盤モデルで、テキスト、画像、音声のモダリティを統合し、知覚、推論、実行機能をネイティブに備えています。このモデルは、ツールの呼び出し、GUI操作、複雑なタスクの自律的な計画をサポートし、音声理解と画像推論の評価では、Gemini 3 ProやClaude Opus 4.6に匹敵する性能を発揮します。以前は「Healer Alpha」というコードネームで匿名でテストされていたこのモデルは、OpenRouterの呼び出しランキングでトップに立ち、現在ではエージェント時代のXiaomiの中核となるAIインフラストラクチャとなっています。
Xiaomi MiMo-V2-Omniの主な特徴
-
完全な感覚知覚このモデルは、テキスト、画像、音声という3つのモダリティを統合することで、画像理解、動画分析、10時間以上の音声処理、そして複数のモダリティを組み合わせた推論を実現します。
-
エージェントの実行機能ツール呼び出し、GUI操作、および自律的なタスク計画をネイティブにサポートしており、戦略の策定、リアルタイムでの修正、および完全な結果のエンドツーエンドでの配信を可能にします。
-
複雑なシナリオアプリケーションウェブブラウジング、コードエンジニアリング、フロントエンド開発など、現実世界のデジタル環境におけるインタラクションタスクを網羅しています。
Xiaomi MiMo-V2-Omniの技術原理
- 統合されたフルモーダルアーキテクチャこのシステムは、テキスト、画像、音声をボトムアップで統合する基本モデルを構築し、統一されたエンコーダーと融合レイヤーを通して、後処理によるモーダル結合なしに、ネイティブなマルチモーダル表現を実現します。
- 知覚と行動の深い統合理解よりも実行を重視する従来のモデルの限界を打破し、エンドツーエンドのトレーニングは、知覚能力とツール呼び出しやGUI操作などの行動能力を統合することで、理解から制御への飛躍を実現します。
- 動画による事前学習と長い文脈本システムは、革新的なビデオ事前学習手法を採用することで、音声と映像の同時理解を実現し、超長時間のコンテキストモデリングをサポートし、複雑なエージェントタスクに対して構造的な優位性を提供します。
Xiaomi MiMo-V2-Omniの主要情報と使用要件
- 出版社Xiaomiテクノロジーチーム
- リリース時間2026年3月19日
- 内部テストコードネームHealer Alpha(以前はOpenRouterに匿名で掲載されていた)
- モデルサイズフルモーダル融合アーキテクチャ(テキスト+画像+音声)
- コンテキストウィンドウ長尺シーケンスモデリングに対応しています(最大1MBまで対応する同シリーズのProバージョンを参照してください)。
- ベンチマークランキングPinchBenchの平均スコアで1位、OpenRouterの通話量でもトップ
- アクセス方法OpenRouterなどのプラットフォームからのAPI呼び出しを通じて、OpenClawなどの主流のエージェントフレームワークとシームレスに統合できます。
- ハードウェア/環境クラウド上にデプロイされるため、ローカルでの設定は不要です。画像、動画、音声ファイル、ストリームなど、マルチモーダルな入力に対応しています。
Xiaomi MiMo-V2-Omniの主な利点
- フルモーダルネイティブ融合これは、テキスト、画像、音声のための統一されたアーキテクチャをゼロから構築し、それらを単につなぎ合わせるのではなく、真のクロスモーダルな理解と共同推論を可能にする。
- 感知と行動の統合「理解を重視するあまり実行を軽視する」という制約から脱却し、ツール呼び出しやGUI操作などの機能をネイティブに統合することで、「認識が正確であればあるほど、行動が効果的になる」という相乗効果を生み出しています。
- 長文コンテキストのサポート数百万個のコンテキストウィンドウをサポートしており、長時間の動画、長時間の音声、複雑な複数ラウンドのエージェントタスクを処理する際に構造的な利点をもたらします。
- 実世界シナリオ検証Healer Alphaの匿名内部テストでは、通話量においてOpenRouterを上回り、PinchBenchでも1位を獲得するなど、市場テストとベンチマークテストの両方でその有効性が証明されました。
- シームレスなエコシステム統合OpenClawなどの主流のエージェントフレームワークと迅速に統合できるため、フルモーダルエージェントの導入におけるハードルを大幅に下げることができます。
Xiaomi MiMo-V2-Omniの使い方
開発者は、https://platform.xiaomimimo.com にアクセスして登録し、APIキーを取得した後、設定された価格(入力:100万トークンあたり0.4ドル、出力:100万トークンあたり2ドル)でAPIを呼び出すことができます。
Xiaomi MiMo-V2-Omni 競合製品比較
| 評価項目 | MiMo-V2-Omni | Gemini 3 Pro | Claude Opus 4.6 |
|---|---|---|---|
| MMAU-Pro (音声理解) | 69.4 | 67.0 | – |
| MMMU-Pro (画像理解) | 76.8 | 81.0 | 73.9 |
| ビデオMME(ビデオ理解) | 85.3 | 88.4 | – |
| CharXiv RQ(チャート理解) | 80.1 | 81.4 | 77.4 |
| FutureOmni(未来予測) | 66.7 | 62.9 | 60.3 |
| MM-BrowserComp(ウェブブラウザ) | 52.0 | 37.2 | 59.3 |
| OmniGAIA(マルチモーダルセンシング) | 49.8 | 62.5 | 59.7 |
| クロー評価(複雑な相互作用) | 54.8 | 51.9 | 66.3 |
| PinchBench(エージェント統合) | 85.6 | 75.0 | 86.3 |
Xiaomi MiMo-V2-Omniの応用事例
- マルチモーダルコンテンツの理解このモデルは、10時間以上の長尺動画の分析、複雑なグラフの解析、および異種モダリティ間の情報関連付け推論をサポートしており、音声と動画を統合的に深く理解することを可能にします。
- インテリジェントエージェントのタスク実行このモデルは、ウェブブラウジング、コードエンジニアリング、フロントエンド開発などのタスクを自律的に完了でき、サンプルを一切使用せずに、精巧にデザインされ、完全に機能するウェブページを生成できる。
- GUI自動化これにより、グラフィカルインターフェースを直接制御でき、戦略立案、リアルタイム修正、および複数ターンにわたる対話における自律的なツールチェーンの呼び出しをサポートします。
- 企業レベルの長文文書処理このモデルは、256Kのコンテキストウィンドウを利用して、長文文書の分析、レポート生成、および自動化されたオフィス業務における意思決定支援を行います。