project
rStar-Math - マイクロソフトの革新的な小型モデル複雑推論および自己進化型SLM向けテクノロジー
rStar-Mathは、Microsoft Research Asiaが立ち上げた革新的な研究プロジェクトです。モンテカルロ木探索(MCTS)に基づく深層思考により、小規模言語モデル(SLM)がOpenAIの大規模数学推論能力に匹敵、あるいはそれを凌駕することを可能にします。
rStar-Mathとは何ですか?
rStar-Mathは、Microsoft Research Asiaが立ち上げた革新的な研究プロジェクトです。モンテカルロ木探索(MCTS)に基づく深層思考により、小規模言語モデル(SLM)が数学的推論において大規模なOpenAIモデルと同等、あるいはそれ以上の性能を発揮することを可能にします。rStar-Mathは、上位レベルモデルからのデータ抽出に頼らず、自己進化型の深層思考によってモデル性能を向上させます。rStar-Mathは、コード強化型段階的検証推論軌跡合成、Q値に基づくプロセス選好モデル(PPM)トレーニング手法、および4ラウンドの自己進化型トレーニング戦略という3つの革新的な手法を導入しています。MATHベンチマークでは、rStar-MathはQwen2.5-Math-7Bの精度を58.8%から90.0%に向上させ、AIME 2024テストでは、平均53.3%の問題を解決し、OpenAIのo1-previewモデルを上回りました。 rStar-Mathは、モデル本来の自己反省能力を示しており、推論過程における誤った手順を特定して修正します。
rStar-Mathの主な機能
- 質の高い数学的推論の軌跡を生成するこのシステムは、モンテカルロ木探索(MCTS)に基づいて段階的な検証推論軌跡を生成し、各ステップの正確性と高品質を保証します。
- 自己進化: 4回の自己進化ラウンドを使用して、戦略モデルとプロセス選好モデル(PPM)の性能を段階的に向上させ、より複雑な数学的問題を処理できるようにする。
- モデルの精度を向上させる複数の数学ベンチマークにおいてモデルの精度を大幅に向上させ、例えば、MATHベンチマークにおけるQwen2.5-Math-7Bの精度を58.8%から90.0%に向上させます。
- 自己反省能力このモデルは、推論過程における誤った手順を特定して修正することができ、自己反省能力を示している。
rStar-Mathの技術的原理
- コード強化型段階的検証推論軌跡合成
- MCTSによる深い思考複雑な数学的問題は複数の単一ステップ生成タスクに分解され、MCTSに基づいて段階的に探索木が構築され、推論軌跡が生成されます。
- コード実行検証この政策モデルは、自然言語(NL)推論の手順と、それに対応するPythonコードを生成します。
- Q値のラベル表示端末誘導型アノテーションとPPM強化型アノテーションという2つの手法に基づき、各ステップにQ値が自動的に割り当てられ、MCTSノードが高品質なステップを選択・識別する際の指針となる。
- プロセス選好モデル(PPM)トレーニング方法
- Q値を直接使用することは避けてください。従来の報酬ラベルとしてのQ値は、ノイズや不正確さの問題を抱えています。rStar-Mathは、段階的な正負の選好ペアを構築し、ペアワイズランキング損失を用いてPPMを学習させることで、ラベルの信頼性を向上させます。
- 建物の好み各ステップにおいて、Q値が最も高い2つのステップを正例として、Q値が最も低い2つのステップを負例として選択します。PPMはこれらの選好ペアを用いて学習され、各ステップの報酬ラベルを予測します。
- 四輪自己進化
- 初期の強力な政策モデル第1ラウンドでは、DeepSeek-Coder-V2-Instructを初期ポリシーモデルとして使用し、MCTSロールアウトを実行してトレーニングデータを生成した。
- 信頼できるPPMトレーニング第2ラウンドでは、更新されたポリシーモデルを使用して、より信頼性の高いQ値ラベリングを行い、最初の信頼性の高いPPMをトレーニングします。
- PPMはMCTSを強化する第3ラウンドでは、信頼性の高いPPMをMCTSに使用し、より多くの数学的および競技レベルの問題を網羅する、より高品質な推論軌跡を生成します。
- 困難な問題を解決する第4ラウンドでは、MCTSの展開回数を増やし、異なる乱数シードを使用して、競争的な問題の網羅性を向上させます。
rStar-Mathプロジェクトのアドレス
- arXiv技術論文:https://arxiv.org/pdf/2501.04519
rStar-Mathの応用シナリオ
- 教育指導このプログラムは、生徒一人ひとりに合わせた数学学習指導を提供し、複雑な数学の問題を段階的に解くことで、問題解決能力と理解力を向上させます。
- 研究支援これは、数学者や科学者が複雑な数学的問題を探求し、問題解決のための予備的なアイデアや検証手順を生み出し、研究プロセスを加速させるのに役立ちます。
- フィンテック金融リスク評価および定量取引においては、正確な数理モデルと論理に基づいて市場リスクを予測し、取引戦略を最適化する。
- エンジニアリング設計工学設計およびシステム最適化においては、システムパラメータを最適化し、システム性能と信頼性を向上させるために数学的推論が用いられる。
- データ分析企業データ分析では、市場予測やビジネス上の意思決定を支援するために、数学モデルと推論に基づいて大量のデータから貴重な情報が抽出されます。