project
FIPO - Alibaba Tongyi によって開始された強化学習アルゴリズム
FIPO(Future-KL Influenced Policy Optimization)は、Alibaba Tongyi Labsが開発した強化学習アルゴリズムです。Future-KLメカニズムを通じて各トークンが後続の推論軌跡に与える影響を定量化し、トークン...
FIPOとは何ですか?
FIPO(Future-KL Influenced Policy Optimization)は、Alibaba Tongyi Labsが開発した強化学習アルゴリズムです。Future-KLメカニズムを通じて各トークンが後続の推論軌跡に与える影響を定量化し、トークンレベルでの正確なクレジット配分を実現し、従来の強化学習における「報酬とペナルティの共有」によって引き起こされる推論のボトルネックを解消します。32Bモデルで純粋な強化学習を行うと、推論長が4000トークンから10000トークン以上に増加し、AIME 2024の精度が50%から58%に向上し、o1-miniを上回り、深層推論における長さのプラトー問題を克服します。
FIPOの主な機能
- トークンレベルでの精密なクレジット配分従来の強化学習における「終点での統一決済」モデルから脱却し、Future-KLメカニズムを通じて推論チェーンにおける重要な決定トークンの約2%を特定して報酬を与えることで、きめ細かな最適化を実現します。
- 推論の長さは自律的に拡大する従来の手法における「長さの停滞」(約4000トークン)というボトルネックを打破することで、モデルは10000トークンを超える深層思考チェーンを生成するようになり、その長さは精度と正の相関関係にある。
- インテリジェントな属性特定とエラー訂正各トークンが後続の軌跡に及ぼす因果的影響を定量化し、「安定したアンカーポイント」を積極的に強化し、「誤解を招くノード」を抑制し、モデルが「正しい答えを自己反転させる」ようなミスを減らします。
- トレーニングの安定性を保証する極値フィルタリング、ソフト減衰ウィンドウ、および影響重み剪定という3つのメカニズムを採用することで、勾配爆発を防ぎ、長鎖推論トレーニングの数値的安定性を確保します。
FIPOの使い方
-
ダウンロードコードGitHubからFIPOコードを入手し、実行環境を設定します(VeRLフレームワークに基づいており、設定方法はDAPOと同様です)。
-
データの準備長い思考過程の例となるデータを用意する必要性をなくすため、標準的な解答検証機能を備えた数学的推論データセット(DAPO-17Kなど)を使用してください。
-
パラメータを調整するソフト減衰ウィンドウの半減期を32ステップに設定し、影響度を1~1.2倍の範囲に制限し、極値フィルタリングを有効にして、トレーニングの安定性を確保します。
-
トレーニングを開始するトレーニングプログラムを実行すると、システムは推論チェーン内の重要なトークンを自動的に識別し、それらに対して正確に報酬または罰則を与えます。トレーニングプロセス中、モデルの応答の長さは自動的に4,000語から10,000語以上に拡張されます。
-
モデル推論モデルの学習が完了すると、使用できるようになります。数学の問題を入力すると、モデルは深い自己検証を伴う一連の思考プロセスを生成し、解答を提示します。
FIPOの主要情報と利用要件
-
正確な識別位置情報推論チェーンにおける主要な意思決定トークンのうち、わずか2%にのみ、対象を絞った報酬と罰則が適用されます。
-
長さのブレークスルー純粋な強化学習では、推論の長さが4000トークンから10000トークン以上に増加し、AIME 2024の精度が50%から58%に向上しました(o1-miniを上回りました)。
-
コールドスタートは不要です: 長い思考連鎖の例を必要とせず、ベースモデルと数学的データを直接トレーニングに使用します。
-
トレーニングフレームワークVeRL + Rayによる分散型トレーニング(32Bモデルには、マルチカードA100/H100クラスタが必要です)。
-
推論環境HuggingFace形式のモデルは、標準的なPyTorch環境で読み込むことができます。
FIPOの主な利点
-
トークンレベルでの精密な報酬と罰則Future-KLメカニズムを使用して推論チェーン内の重要な決定トークンのわずか2%を特定することで、きめ細かなクレジット配分が実現され、従来の強化学習における「終点での統一決済」に伴う報酬とペナルティの分配問題が解消されます。
-
長さのボトルネックを突破する従来の4,000トークンという「ガラスの天井」を打ち破り、モデルが10,000トークンを超える深い推論チェーンを自律的に生成するように促し、その長さと精度の間には強い正の相関関係が見られます。
-
ピュアRLゼロコールドスタート長々とした思考連鎖の例となるデータは不要です。ベースモデルと検証可能な報酬データを用いて直接トレーニングを行うことで、深い推論能力を刺激することができ、データ準備のコストを大幅に削減できます。
-
最先端性能32Bスケールの純粋なRL設定において、AIME 2024の精度は58%(ピーク)に達し、o1-mini(56%)およびDeepSeek-R1-Zero-32B(47%)を上回りました。
-
トレーニングは安定しており、制御可能である。トリプル保護メカニズム(極値フィルタリング+ソフト減衰ウィンドウ+重み剪定)により、Future-KLの分散を効果的に抑制し、長鎖学習における勾配爆発や壊滅的な崩壊を防ぎます。
FIPOプロジェクトの住所
- GitHubリポジトリ:https://github.com/qwenpilot/FIPO
- arXiv技術論文:https://arxiv.org/pdf/2603.19835
FIPOの類似製品との比較
| 比較対象寸法 | FIPO | DAPO | GRPO |
|---|---|---|---|
| コアメカニズム | Future-KLブートストラップ推定 | 非対称クロッピング+動的サンプリング | グループ相対優位性 + KLペナルティ |
| 信用配分 | トークンレベルの精度(2%のキートークンを特定する) | 軌道レベル平均(すべてのトークンは同じ報酬を受け取ります) | 軌道レベル平均(すべてのトークンは同じ報酬を受け取ります) |
| コールドスタートデータ | 不要ロングCoTデータ | 不要ロングCoTデータ | 不要ロングCoTデータ |
| 推論の長さ | 10k+ Token(継続的な成長) | ~4k Token(停滞のボトルネック) | ~4k Token(停滞のボトルネック) |
| AIME 2024(32B) | 58%(ピーク) | 50% | ~47% |
| vs o1-mini | 超えて(56%) | 超えられなかった | 超えられなかった |
| 利点評価方法 | Future-KL影響力加重 | 統合グループのメリット | 統合グループのメリット |
| トレーニングの安定性 | (勾配爆発に対する)三重保護 | 標準動的サンプリング | エントロピー崩壊が起こる可能性が高い。 |
FIPO申請シナリオ
- 数学コンテストと研究支援AIME/IMOレベルの非常に難しい数学問題を解き、自己検証機能を備えた完全な導出過程を生成し、数学者が複雑な証明のアイデアを探求するのを支援します。
- 複雑なコード生成とデバッグ: 多段階の論理分解を必要とするアルゴリズムの問題(LeetCodeの難易度の高い問題など)を処理し、長い連鎖推論を通じてコードエラーの根本原因を分析し、修正を提供する。
- 自動定理証明形式数学や論理学の分野では、前提から結論に至る厳密な議論の連鎖を構築し、証明プロセスの完全性を自動的に検証する。
- 科学的研究の推論物理学や化学などの分野における複雑な公式の導出や実験計画の分析を支援し、深い思考を通して多次元的な制約を統合する。
- 戦略的意思決定とビジネス分析これは、投資分析やサプライチェーン最適化など、複数の要素を考慮する必要があるビジネス上の意思決定問題に対処し、リスク検証を含む意思決定に関する推奨事項を生成します。