project
MM-Eureka - 上海AIラボが上海交通大学およびその他の機関と共同で開発したマルチモーダル推論モデル。
MM-Eurekaは、上海人工知能研究所、上海イノベーション研究所、上海交通大学、香港大学の研究者らが共同開発したマルチモーダル推論モデルです。このモデルは、ルールベースの大規模強化学習(RL)を利用して、
MM-Eurekaとは何ですか?
MM-Eurekaは、上海人工知能研究所、上海イノベーション研究所、上海交通大学、香港大学の研究者らが共同開発したマルチモーダル推論モデルです。このモデルは、ルールベースの大規模強化学習(RL)を通じて、単一モーダル推論の主要な特徴(安定した応答長の増加、精度報酬、視覚的洞察の瞬間など)をマルチモーダルシナリオに拡張します。
MM-Eurekaは、InternVL2.5-Instruct-8BとInternVL2.5-Pretrained-38Bをそれぞれベースとした、MM-Eureka-8BとMM-Eureka-Zero-38Bという2つのコアモデルを導入しています。ルールベースの強化学習トレーニングに54,000件のグラフテキストデータのみを使用した場合、その平均パフォーマンスは100万件のデータを使用したMPOモデルを上回ります。MM-Eureka-Zero-38Bは、8,000件のグラフテキスト数学的推論データのみを使用し、独自に構築したK12ベンチマークでインストラクションモデルを8.2%上回り、MathVerseでも同様の性能を発揮します。
MM-Eurekaの主な機能
- マルチモーダルな推論能力これは、大規模なルールベースの強化学習(RL)をマルチモーダル推論の分野に拡張し、テキスト情報と画像情報の両方を扱うことができる。
- 主要機能を再現するDeepSeek-R1などのテキスト強化学習システムの主要な特徴は、マルチモーダル空間でも再現され、精度報酬や応答長の着実な改善、そして反省的行動の出現などが含まれる。
- データ効率通常の強化学習トレーニングに54Kの画像とテキストデータのみを使用した場合、平均パフォーマンスは1Mのデータを使用したMPOモデルを上回り、全体的なベンチマーク精度は12Mのデータを使用してCoT SFTでトレーニングされたモデルと同等でした。
MM-Eurekaの技術原理
- ルールベースの大規模強化学習フレームワークMM-Eurekaは、OpenRLHFをベースに開発された、効率的で拡張性の高いマルチモーダル大規模強化学習フレームワークであり、InternVLなどの様々なモデルや強化学習アルゴリズムをサポートしています。これにより、マルチモーダル環境におけるモデルの効果的なトレーニングが可能になり、精度報酬や応答長の着実な向上など、DeepSeek-R1の主要な特徴を再現することに成功しています。
- データフィルタリングと安定したトレーニング研究チームは、安定した強化学習にはデータ選択が不可欠であることを発見した。難易度に基づいたデータフィルタリング戦略は、強化学習の安定性において重要な役割を果たす。
- 視覚的なひらめきの瞬間MM-Eurekaは、トレーニング中にDeepSeek-R1と同様の視覚的洞察力を発揮します。具体的には、モデルは画像内の重要な情報を再検討し、振り返りを行うことを学習します。
- ミニマリスト強化学習設計ミニマルな強化学習設計はMM-Eurekaで効果的であることが証明されました。インストラクティブモデルで実験を行った際、KLダイバージェンスを追加することでモデルの探索が制限され、応答長の改善は観察されませんでした。MM-Eurekaは、単純な報酬関数(精度報酬やフォーマット報酬など)を採用し、難易度に基づくデータフィルタリング戦略によって安定した学習を実現しています。
- 効率的なデータ活用MM-Eurekaは極めて高いデータ効率性を示しています。ルールベースの強化学習トレーニングにわずか54,000のグラフテキストデータを使用するだけで、100万のデータを使用するMPOモデルの平均パフォーマンスを上回ります。MM-Eureka-Zeroは、わずか8,000のグラフテキスト数学的推論データ(インストラクションモデルの0.05%)を使用するだけで、独自に構築したK12ベンチマークでインストラクションモデルを8.2%上回り、MathVerseでも同様の性能を発揮します。これは、マルチモーダル推論の分野では、シンプルなルールベースの強化学習設計によってトレーニング効果を大幅に向上させることができ、限られたデータでも大規模トレーニングに匹敵するパフォーマンスを達成できることを示しています。
MM-Eurekaプロジェクトの住所
- GitHubリポジトリ:https://github.com/ModalMinds/MM-EUREKA
- arXiv技術論文:https://arxiv.org/pdf/2503.07365
MM-Eurekaの応用シナリオ
- 教育MM-Eurekaは、強力な推論および考察メカニズムを通じて、生徒が複雑な数学の問題をよりよく理解し、解決できるよう支援します。
- 拡張現実(AR)と仮想現実(VR)AR(拡張現実)やVR(仮想現実)のシナリオにおいて、MM-Eurekaは視覚情報と言語情報を組み合わせることで、ユーザーにより没入感のあるインタラクティブな体験を提供することができます。
- データ分析と意思決定支援MM-Eurekaのマルチモーダル推論機能は、データ分析と意思決定支援において大きな優位性をもたらします。複雑なテキストデータや画像データを処理できるため、ユーザーは大量のデータから重要な情報を抽出し、より的確な意思決定を行うことができます。
- 自動化とインテリジェントアシスタントMM-Eurekaは、インテリジェントアシスタントの中核技術として機能し、ユーザーによりインテリジェントで自然な対話体験を提供することができます。
- ゲームとエンターテイメントゲームおよびエンターテインメント業界において、MM-Eurekaのマルチモーダル推論機能は、より知的なノンプレイヤーキャラクター(NPC)やインタラクティブなストーリーラインの開発に活用できる。