project
EAPO - Alitongyiが発表した新しい強化学習フレームワーク
EAPOは、アリババ同義研究所が開発した長文推論強化学習フレームワークです。「証拠報酬」メカニズムを導入することで、監視信号が最終的な解答から証拠抽出プロセスへと移行します。
EAPOとは何ですか?
EAPOは、アリババ同義研究所が開発した長文推論強化学習フレームワークです。「証拠報酬」メカニズムを導入することで、監視信号を最終的な回答から証拠抽出プロセスへと移行させています。このフレームワークはACL 2026に採択され、8つの権威ある長文ベンチマークテストにおいて、容量120Bのクローズドソース大規模モデルであるGPT-OSSやClaude-Sonnet-4を上回る性能を、30B規模のモデルで実現しました。
EAPOの主な機能
-
構造化された証拠推論強制モデルは、タスク分析、証拠抽出、推論実行、回答生成という4段階のワークフローを実行します。各段階は特別なトークンで区切られており、中間段階の証拠の状態を直接監視できます。
-
多粒度プロセス報酬形式準拠報酬、グループ相対証拠品質報酬、結果精度報酬を含む複合報酬シグナルを構築し、疎な結果監視から集中的なプロセス監視へと移行する。
-
グループ相対的証拠評価同一の問題に対して複数の証拠軌跡がサンプリングされ、報酬モデルがそれらを一律に評価し、1~5の整数値の品質スコアを付与します。その後、スコアはグループ内で正規化され、相対的な報酬が生成されます。これにより、モデルは高品質の証拠の抽出を優先的に行うように誘導されます。
-
報酬戦略の共進化この設計には、戦略モデルによって生成された信頼性が高く、一貫性があり、質の高い証拠連鎖をフィルタリングし、それを報酬モデルにフィードバックして拒否の微調整を行う適応型閉ループ機構が組み込まれており、モデルの能力が向上するにつれて評価基準が動的に進化するようになっている。
-
長文推論機能の強化SEALやLongBench-V1/V2を含む8つの権威ある長文テキストベンチマークにおいてパフォーマンスが大幅に向上し、30Bモデルが120BのGPT-OSSやClaude-Sonnet-4といったクローズドソースの大規模モデルを長文テキスト推論で凌駕することが可能になりました。
EAPOの技術原則
- 証拠に基づく推論(EAR)パラダイムこのアプローチは構造化された推論パラダイムを確立し、モデルが回答を生成する前に、元のテキストから関連する証拠の断片を逐語的に抽出することを強制します。特別なトークンを使用することで、プロセスは「タスク分析 → 証拠抽出 → 推論実行 → 回答生成」の4つのステップに分割されます。これにより、中間的な証拠の状態が明らかになり、直接的な監視が可能になるため、従来のモデルにおける「正しい答えを推測しているが、間違った答えを引用している」という錯覚の問題を根本的に解決します。
- グループ相対証拠報酬EAPOは、強化学習の最適化目標を「正しい結果」から「正しい証拠」へと転換します。トレーニング中、モデルは同じ質問に対して複数の異なる証拠の軌跡をサンプリングします。報酬モデルはこれらの証拠セットを同時に評価し、サンプリングされたグループ内での相対報酬[0,1]に正規化された1~5の効用スコアを割り当てます。この集中的なプロセス監視により、モデルは「正しい答えを推測する」よりも「正しい証拠を見つける」ことの方が重要であることを学び、パラメータ設定の安易な近道を効果的に抑制します。
- 適応型報酬ポリシーの共進化ポリシーモデルの能力が向上するにつれて、固定報酬モデルでは証拠の質の微妙な違いを区別することが徐々に困難になります。EAPOは自己強化型の閉ループを設計しています。結果に一貫性のある拒否微調整を通じて、「高い証拠スコアと正解」または「低いスコアと不正解」の信頼性の高い展開データをフィルタリングし、これらのインスタンスを使用して報酬モデルを監視および微調整します。ポリシーモデルが強力であればあるほど、生成されるトレーニングデータはより良くなります。報酬モデルの評価がより正確であればあるほど、ポリシーモデルをより正確な証拠を抽出するように導くことができ、動的で同期的な進化を実現します。
- GRPOベースの複合報酬メカニズムEAPOは、基本アルゴリズムとしてグループ相対ポリシー最適化(GPO)を採用し、多段階の複合報酬を構築します。フォーマット準拠報酬(α=0.1)は出力がEAR構造に準拠していることを保証し、グループ相対証拠品質報酬(β=0.3)はプロセス監視を提供し、結果精度報酬(γ=0.6)は最終回答を検証します。これら3つの報酬の加重組み合わせにより、疎な結果シグナルが密なプロセス指向のガイダンスに変換されます。
EAPOの主要情報と利用要件
-
研究開発チームアリババ同義研究室のXin Guan、Zijian Li、Shen Huangらが執筆したこの論文は、ACL 2026に採択された。
-
基本モデルトレーニングは、Qwen3-14B(高密度アーキテクチャ)、Qwen3-30B-A3B-Instruct(MoEアーキテクチャ)、およびQwen3-30B-A3B-Thinkingの3つのモデルに基づいています。
-
コンテキストの長さトレーニング用サンプルと評価用サンプルは、いずれも12万8千トークンに制限されています。
-
トレーニングデータ4,664個の複合サンプル。32,000~128,000件のコンテキスト情報を含むマルチホップQA(MuSiQue)とWikipediaのハイブリッドQA(構造化+非構造化)を網羅。
-
報酬モデルQwen3-30B-A3B-Thinkingに基づいて初期化され、20 RL ステップごとに更新されます。
-
報酬の重み形式は、α=0.1、証拠の質β=0.3、結果の正確性γ=0.6に従う。
-
コアアルゴリズムGRPO(グループ相対ポリシー最適化)に基づき、グループベースの相対的証拠報酬と共進化メカニズムを導入する。
-
モデルの基本長文テキストに対応したQwen3シリーズモデルで学習させる必要があり、最適な結果を得るには30B-A3B-Thinkingが推奨されます。
EAPOの主な利点
- プロセス監視の革新長文強化学習における報酬の疎なボトルネックを打破し、初めて証拠レベルの密なプロセス監視を実現し、モデルに「分析→証拠抽出→推論→応答」という4段階のワークフローを実行させ、推論の各段階を追跡可能にする。
- パフォーマンスの飛躍的向上Qwen3-30B-Thinkingに基づいて学習されたモデルは、平均スコア63.1%を達成し、GPT-OSS(120B)やClaude-Sonnet-4などの大規模なクローズドソースモデルを上回り、小さなモデルでも大規模なモデルを凌駕できることを示した。
- エラーダブルドロップ証拠の誤り率は17.7%から13.5%に、推論の誤り率は20.7%から15.4%に減少し、推論過程を明示的に監視することなく、両方のタイプの誤りを同時に減少させることができた。
- トレーニング効率において業界をリード結果報酬のみに依存するGRPOベースラインと比較して、EAPOは収束速度が著しく速く、精度の上限も高く、トレーニングプロセス全体を通してエビデンス品質スコアで常に優位に立っています。
- 評価基準の変遷報酬モデルとポリシーモデルは、信頼性の高い展開データを通じて継続的に反復および共進化し、モデルの能力が向上するにつれて固定的な評価基準を回避する。
EAPOプロジェクトの住所
- 技術論文:https://arxiv.org/pdf/2601.10306
EAPOの類似競合製品との比較
| 比較対象寸法 | EAPO | GRPO | QwenLong-32B |
|---|---|---|---|
| テクニカルルート | 証拠に基づいた強化学習トレーニングフレームワーク | 標準グループ相対戦略最適化 | 長文テキストに特化したモデルトレーニング |
| 監視信号 | 証拠重視型のプロセス報酬+成果報酬 | わずかな成果しか報われない | 暗黙的な長文最適化 |
| 証拠の明示的な抽出 | 強制的な4段階構造出力 | なし | なし |
| 報酬モデルの進化 | 適応型共進化閉ループ | 報酬なしモデル | 関与していない |
| 長文のターゲティング | 128Kの高ノイズ環境向けに特別に設計されています | 一般的な | 強力 |
| 代表的なパフォーマンス | 63.1%(30B、8ベースライン平均) | 59.2%(300億ドルを基準値として) | 57.8% |
| 基本的な制約 | 報酬モデルは独立して維持される必要がある。 | 「正解を推測する」という近道を抑えられない | 明確な証拠監視メカニズムは存在しない |
EAPOの適用シナリオ
- AI検索と質問応答AI検索エンジンの根本的な問題点である「正しく検索するものの、誤った回答をする」という問題を解決するため、このシステムは、膨大な検索結果から裏付けとなる証拠を正確に特定して引用するようにモデルに強制することで、錯覚に基づく回答を排除します。
- 専門分野の文書分析これは、法律、金融、医療、その他、厳密な事実に基づいた判断が求められるあらゆる場面に適用され、すべての報告書および分析が明確な情報源を持ち、証拠の連鎖によって裏付けられていることを保証する。
- 科学文献レビュー複数の論文にわたる相互検証と包括的な推論をサポートし、重要な実験データを自動的に抽出して正確に引用することで、すべてのレビュー結論が文献によって裏付けられていることを保証します。
- エンタープライズナレッジベースに関するQ&A非常に長い社内文書、契約書、マニュアルの中から意思決定の根拠を正確に特定し、従業員が明確な情報源に基づいて迅速に業務上の回答を得られるよう支援します。
- 教育指導と自動採点問題解決の指導に用いる場合、推論の各段階に原文の証拠を明記する必要があり、自動採点時には、生徒の解答が問題文中の有効な情報に基づいているかどうかを検証する。