project
MiMo-V2-Flash - Xiaomiのオープンソース高性能言語モデル
MiMo-V2-Flashは、Xiaomiがオープンソース化した高性能言語モデルで、総パラメータ数3090億、アクティベーションパラメータ数150億を誇ります。エージェントAI向けに特別に設計されており、スライディングウィンドウアテンション(SWA)とグローバルアテンションを組み合わせたハイブリッドアテンションアーキテクチャを採用しています。
MiMo-V2-Flashとは何ですか?
MiMo-V2-Flashは、Xiaomiがオープンソース化した高性能言語モデルで、総パラメータ数3090億、アクティベーションパラメータ数150億を誇ります。エージェントAI向けに特別に設計されており、スライディングウィンドウアテンション(SWA)とグローバルアテンション(GA)を組み合わせたハイブリッドアテンションアーキテクチャを採用し、ウィンドウサイズは128トークンです。学習可能なアテンションシンクバイアス技術により、長文テキストでもパフォーマンスを維持しながら、KVキャッシュストレージを大幅に削減します。さらに、軽量なマルチトークン予測(MTP)モジュールを搭載しており、各モジュールはわずか3300万個のパラメータしか含まず、密なフィードフォワードネットワーク(FFN)とSWAを使用して生成速度を大幅に向上させています。これにより、推論コストはベンチマークのクローズドソースモデルであるClaude 4.5 Sonnetのわずか2.5%となり、2倍の高速化を実現しています。MiMo-V2-Flashは、SWE-Benchや数学的推論タスクなど、さまざまなエージェントタスクや複雑な推論タスクにおいて優れたパフォーマンスを発揮します。 FP8混合精度推論をサポートしており、SGLangフレームワークを使用した展開に推奨されます。
MiMo-V2-Flashの主な機能
-
高性能推論ハイブリッドアテンションアーキテクチャと軽量マルチトークン予測技術を採用することで、推論効率を大幅に向上させ、トークン生成を高速化し、推論コストを大幅に削減します。
-
長文処理機能スライディングウィンドウアテンションとグローバルアテンションを組み合わせることで、最大256Kのコンテキスト長をサポートし、長文テキストの処理に適しています。
-
エージェントタスクの最適化これはエージェントAI向けに特別に設計されており、大規模なエージェント強化学習とマルチティーチャーオンラインポリシー抽出を通じて、複雑な推論や複数ターンの対話タスクに適しています。
-
コード生成と理解コード生成と理解のタスクに優れており、複数のプログラミング言語をサポートし、コードの補完、生成、デバッグのタスクを効率的に完了できます。
-
多言語対応多言語対応機能を備えており、複数の言語でのテキスト生成、翻訳、理解といったタスクを処理できます。
-
オープンソースで使いやすいモデルの重みと推論コードはMITライセンスに基づき完全にオープンソース化されているため、開発者は容易に利用したり、二次開発を行ったりすることができます。
MiMo-V2-Flashの技術原理
-
ハイブリッドアテンションアーキテクチャ本手法は、スライディングウィンドウアテンション(SWA)とグローバルアテンション(GA)を組み合わせたハイブリッド設計を採用し、ウィンドウサイズは128トークンです。学習可能なアテンションシンクバイアス技術により、キーバリューキャッシュの保存量を削減しながら、長文テキストの処理能力を維持します。
-
軽量マルチトークン予測(MTP)軽量なMTPモジュールを搭載し、密なフィードフォワードネットワーク(FFN)とスライディングウィンドウアテンションを採用することで、各モジュールのパラメータ数はわずか3300万個となり、生成速度を大幅に向上させ、推論効率を最適化します。
-
高効率な事前トレーニング事前学習には27兆トークンを使用し、ネイティブの32Kシーケンス長をサポート、コンテキストウィンドウは256Kまで拡張可能です。学習効率を向上させるために、FP8混合精度学習を採用しています。
-
エージェント強化学習大規模なエージェント強化学習とマルチティーチャーオンラインポリシー蒸留(MOPD)により、複雑な推論やエージェントタスクにおいて優れた性能を発揮し、モデルの汎化能力とタスク適応性を向上させます。
-
推論最適化FP8混合精度推論をサポートしており、SGLangフレームワークと組み合わせることで高性能な推論を実現するため、大規模な展開やアプリケーションに適しています。
MiMo-V2-Flashプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/xiaomimimo/MiMo-V2-Flash
- ハギングフェイスモデルライブラリ:https://huggingface.co/XiaomiMiMo/MiMo-V2-Flash
- 技術論文:https://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
MiMo-V2-Flashの応用事例
-
インテリジェントエージェント向けのAIタスク効率的な推論と複雑なタスク処理を必要とするインテリジェントエージェントのシナリオに適しています。例えば、自動タスク実行、複数ターンにわたる対話管理、ツール呼び出しなどです。
-
長文処理長文コンテンツの作成、文書の要約、長文の質問への回答など、長文の生成および理解タスクを処理できます。
-
コード生成と理解コード生成、コード補完、コード理解をサポートしており、開発者ツールや自動プログラミング支援との統合に適しています。
-
多言語アプリケーション多言語対応機能を備えており、異言語翻訳、多言語コンテンツ生成、国際的なアプリケーション開発などに利用できます。
-
複雑な推論タスク数学的推論、論理的推論、科学的問題解決といった複雑なタスクに優れており、教育や研究に適している。
-
デイリーアシスタント汎用AIアシスタントとして、日常的な質問への回答、情報検索、パーソナライズされたコンテンツの推薦などに利用できます。