AB
AiBoss
project

OpenR - ユニバーシティ・カレッジ・ロンドンは、他の複数の大学と協力して、大規模モデルの推論能力を向上させるためのフレームワークを発表しました。

OpenRは、ユニバーシティ・カレッジ・ロンドン(UCL)、上海交通大学、リバプール大学、香港科技大学(広州)、および西湖大学が共同でオープンソース化した、フルチェーンのトレーニングフレームワークです。大規模言語モデル(LLM)の性能向上を目指しています。

OpenRとは何ですか?

OpenRは、ユニバーシティ・カレッジ・ロンドン(UCL)、上海交通大学、リバプール大学、香港科技大学(広州)、および西湖大学が共同開発したオープンソースのフレームワークです。探索、強化学習、および手続き型監視を組み合わせることで、大規模言語モデル(LLM)の推論能力を強化します。推論プロセス中に強化学習を統合することで推論能力を大幅に向上させるOpenAIのo1モデルに触発されたOpenRは、アンサンブル技術のオープンソース実装を提供する最初のフレームワークであり、効率的なデータ取得、トレーニング、および推論パスに基づいてLLMが高度な推論を実現できるようサポートします。OpenRは、オンライン強化学習トレーニングとさまざまな探索戦略をサポートし、テスト時のスケーリングルールに準拠することで、生成または探索を通じてテスト中にモデルが洗練された出力を提供できるようにします。OpenRは、結果ラベルから推論ステップを抽出する自動化されたデータパイプラインを提供し、貴重な推論情報の収集を確実にしながら、手動アノテーションの作業負荷を軽減します。

OpenRの主な機能

  • 統合トレーニングと推論データ取得、強化学習トレーニング(オンラインおよびオフライン)、非自己回帰デコーディングを統合した統一プラットフォームです。
  • プロセス報酬モデル(PRM)トレーニング中、LLMポリシーはポリシー最適化技術に基づいて改善され、LLMの探索プロセスはデコード段階で誘導される。
  • 学習環境を向上させるこの数学的問題はマルコフ決定過程(MDP)としてモデル化され、強化学習手法に基づいてモデル戦略が最適化される。
  • マルチ戦略探索と解読ビームサーチやベストオブNなどの複数の検索アルゴリズムをサポートし、ガイド付き検索やPRMに基づく評価と組み合わせることができます。
  • データ拡張と自動注釈自動化された手法に基づいて合成サンプルを生成し、手動による注釈への依存度を減らし、データ収集の効率を向上させる。

OpenRの技術的原則

  • プロセス報酬モデル(PRM)PRMは、解決手順の正しさを評価するために使用されます。教師あり学習に基づいて、正解か不正解かの判断を分類ラベルとして使用し、各手順の後続ラベルを予測します。
  • 戦略の反復トレーニング中、PRMはポリシー反復などのポリシー最適化手法に基づいてLLMポリシーを改善します。デコード段階では、PRMはLLM探索プロセスを誘導し、推論がより効果的な結果へと発展するようにします。
  • マルコフ決定過程(MDP)数学的な問題は、状態、行動、報酬から構成されるマルコフ決定過程(MDP)に変換される。このモデルは、行動として推論ステップを生成し、現在の状態と行動に基づいて次の状態を決定する。
  • 強化学習オンライン強化学習のトレーニングは、モデルによって生成される言語出力を最適化するために、近接方策最適化(PPO)やグループ相対方策最適化(GRPO)などのアルゴリズムを使用して実行されます。
  • 検索アルゴリズムデコード段階では、PRMを使用して各解決ステップの精度が評価され、言語モデルと連携してガイド付き検索や複数の生成スコアまたは投票が実行されます。

OpenRプロジェクトのアドレス

OpenRの応用シナリオ

  • 数学の問題を解くOpenRは、正しい解法を見つけるための推論手順を生成・評価することで、数学の問題解決を支援します。
  • コード生成とデバッグソフトウェア開発において、OpenRはコードスニペットの生成や、デバッグ中のコード内のエラーの発見と修正に役立ちます。
  • 自然言語処理(NLP)タスクOpenRは、機械読解、質問応答システム、テキスト要約など、テキストの深い理解と論理的推論を必要とする自然言語処理タスクで使用されます。
  • 教育支援教育分野において、OpenRは学生が複雑な概念や問題解決の手順を理解するのを助ける補助ツールとして機能し、個々の学習者に合わせた学習経路を提供する。
  • 自動化された顧客サービス顧客サービス分野において、OpenRはユーザーの質問やニーズに関する推論に基づき、正確な回答と解決策を提供します。