AB
AiBoss
project

Xiaomi MiMo - Xiaomi初のオープンソース大規模推論モデル

Xiaomi MiMoは、複雑な推論タスクのパフォーマンス向上を目的として設計された、Xiaomi初のオープンソース推論モデルです。このモデルは、事前学習と事後学習を組み合わせ、大量の豊富な推論コーパスを活用し、革新的な手法を採用しています。

Xiaomi MiMoとは何ですか?

Xiaomi MiMoは、Xiaomi初のオープンソース大規模推論モデルであり、複雑な推論タスクのパフォーマンス向上をサポートします。事前学習と事後学習を組み合わせたこのモデルは、豊富な推論コーパスを大量にマイニングし、革新的な強化学習アルゴリズムを採用することで、数学的推論とコード生成能力を大幅に向上させます。わずか70億個のパラメータで、MiMoは公開ベンチマークデータセットにおいて、OpenAIのo1-miniやAlibaba QwenのQwQ-32B-Previewといった大規模モデルを凌駕します。Xiaomi MiMoには、事前学習済みモデルのMiMo-7B-Base、教師ありファインチューニングモデルのMiMo-7B-SFT、強化学習モデルのMiMo-7B-RLとMiMo-7B-RL-Zeroの4つのモデルバージョンがあり、これらはすべてHuggingFaceでオープンソース化され、開発者に強力な推論ツールを提供します。

Xiaomiが新たにリリースしたオープンソースの大規模言語モデル「MiMo-V2-Flash」は、スライディングウィンドウアテンション(ウィンドウサイズ128)とグローバルアテンションを5:1の比率で交互に使用することで、キーバリューキャッシュを約6分の1に削減しつつ、長文テキストにおけるパフォーマンスと効率のバランスを実現しています。複数のトークンの並列予測をサポートし、平均許容長は2.8~3.6、推論速度は2~2.6倍向上しており、特にエンコーディングタスクの効率を最適化しています。複数のベンチマークテストにおいて、DeepSeek-V3.2やKimi-K2といった主要なオープンソースモデルに匹敵する性能を発揮しています。

Xiaomi MiMoの主な機能

  • 優れた数学的推論能力複雑な数学的問題を解決し、正確な推論過程と解答を提供する。
  • 非常に効率的なコード生成機能様々なプログラミング作業に適した高品質なコードを生成します。
  • 最適化された推論パフォーマンス事前学習と事後学習の相乗効果によって推論能力を向上させることで、パラメータ規模が70億の大規模モデルを凌駕し、非常に効率的な推論性能を実現しています。

Xiaomi MiMoの技術原理

  • 事前トレーニング段階本研究では、豊富な推論コーパスのマイニングに重点を置き、約2000億件の推論データを合成することで、モデルがより多くの推論パターンを学習できるようにしました。3段階のトレーニングに基づき、トレーニングの難易度を段階的に上げ、合計25兆トークンのトレーニングデータを用いることで、モデルが様々な難易度のタスクにおいて能力を段階的に向上させることができました。
  • トレーニング後の段階
    • 強化学習アルゴリズム難易度の高いアルゴリズム問題における報酬の疎性問題を軽減し、複雑なタスクにおけるモデルのパフォーマンスを向上させるために、テスト難易度駆動型報酬アルゴリズムを導入します。
    • データ再サンプリング戦略強化学習(RL)のトレーニングプロセスを安定化させるための、簡単なデータ再サンプリング戦略を紹介します。
    • 高効率トレーニングフレームワーク強化学習のトレーニング(2.29倍)と検証(1.96倍)を高速化し、トレーニング効率を向上させるためのシームレスロールアウトシステムを設計する。
  • モデルアーキテクチャの最適化推論タスク向けにモデルアーキテクチャを最適化し、限られた数のパラメータで効率的な推論機能を実現する。

Xiaomi MiMoプロジェクトの住所

Xiaomi MiMoの応用事例

  • 教育数学の問題解決やプログラミング学習を支援するために、解法手順とコード例を提供します。
  • 科学研究と学術論理的推論やアルゴリズム開発を支援し、仮説の検証や実験設計に役立ちます。
  • ソフトウェア開発コードの生成と最適化を行い、コードのデバッグと問題解決を支援する。
  • インテリジェントな顧客サービス複雑な質問に答え、質疑応答システムの効率を向上させるため。
  • ゲームとエンターテイメント戦略的なアドバイスや頭の体操問題の解決策を提供することで、ゲームの楽しさを高めます。