project
PRefLexOR - MITチームが発表した新しい自己学習型AIフレームワーク
PRefLexOR(Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning)は、MITの研究チームが提案した、選好最適化と…を組み合わせた新しい自己学習型AIフレームワークです。
PRefLexORとは何ですか?
PRefLexOR(Preference-based Recursive Language Modeling for Exploratory Optimization of Reasoning)は、MITの研究チームが提案した新しい自己学習型AIフレームワークです。選好最適化と強化学習(RL)の概念を組み合わせることで、反復推論を通じてモデルの自己学習能力を向上させます。フレームワークの中核となるのは再帰推論アルゴリズムで、モデルはトレーニングと推論中に複数の推論ステップを実行し、中間ステップをレビューして洗練することで、最終的に精度の高い出力を生成します。PRefLexORは、好ましい応答と好ましくない応答の対数オッズ比を最適化することで推論パスを調整する、アドバンテージ比選好最適化(ORPO)に基づいています。また、拒否サンプリングによって推論品質をさらに向上させるために、直接選好最適化(DPO)も統合しています。
PRefLexORの主な機能
- 動的知識グラフの構築このフレームワークは、事前に生成されたデータセットに依存せず、タスクと推論ステップを動的に生成して、リアルタイムで知識グラフを構築します。これにより、モデルは推論プロセス中に新しいタスクに継続的に適応し、知識を動的に拡張することができます。
- 異分野横断的な推論能力PRefLexORは、さまざまな分野の知識を統合し、それらに基づいて推論を行うことができます。例えば、材料科学においては、モデルは再帰的推論と知識グラフを通して、新しい設計原理を生成することができます。
- 自律的な学習と進化PRefLexORは、再帰的な最適化とリアルタイムのフィードバックを通じて、トレーニング中に自己学習を行い、推論戦略を継続的に改善し、人間と同様の深い思考力と自律的な進化能力を発揮することができる。
PRefLexORの技術原理
- 再帰的推論と反省PRefLexORは、「思考トークン」と「反省トークン」を導入することで、推論プロセスの中間段階と反省段階を明確に示します。このモデルは、推論中に初期応答を生成し、その後反省を通してそれを洗練させ、最終的に、より正確な回答を生成します。
- 嗜好の最適化PRefLexORは、優位性比率選好最適化(ORPO)と直接選好最適化(DPO)に基づいています。このモデルは、好ましい応答と好ましくない応答間の対数優位性比率を最適化することで、推論経路を人間の選好意思決定に合わせます。DPOは、棄却サンプリングによって推論の質をさらに向上させ、選好の整合性における微妙な違いを確実に検出します。
- 多段階トレーニングPRefLexORの学習は複数の段階に分かれています。まず、ORPOを用いて推論パスを整合させ、次にDPOを用いて推論品質をさらに最適化します。このハイブリッドアプローチは、強化学習におけるポリシー改良に似ており、リアルタイムのフィードバックと再帰的な処理を通してモデルを継続的に改善していきます。
PRefLexORプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/lamm-mit/PRefLexOR
- arXiv技術論文:https://arxiv.org/pdf/2410.12375
PRefLexORの応用シナリオ
- 材料科学と設計PRefLexORは、材料科学分野において強力な推論能力を発揮します。動的に生成される質問と検索強化技術(RAG)を用いることで、ランダムなテキストから情報を抽出し、動的な知識グラフを構築することができます。
- ドメイン横断的推論PRefLexORは、異なる分野の知識を統合し、学際的な推論と意思決定を行うことができます。生体材料科学においては、再帰的推論と内省的メカニズムを通して生物学的原理と材料科学を組み合わせ、新たな解決策を提案することが可能です。
- オープン領域の問題解決強化学習に基づく自己学習システムであるPRefLexORは、オープンドメインの問題を解決し、反復的な最適化とフィードバック駆動型学習を通じて推論経路を継続的に改善することができます。
- 生成材料情報学PRefLexORは、材料情報学のワークフローを生成するために使用でき、情報を知識と実用的な結果へと変換します。多段階の推論と自己評価を通じて、より複雑な予測を可能にし、材料予測の継続的な改善を支援します。