AB
AiBoss
project

SWEET-RL - Meta社が発表した複数ラウンド強化学習フレームワーク

SWEET-RLは、Meta社が開発したマルチターン強化学習フレームワークで、特に大規模言語モデル(LLM)エージェントを協調推論タスク向けにトレーニングするように設計されています。SWEET-RLは、トレーニング中に(参照解などの)追加情報に基づいて「批評家」を最適化します。

SWEET-RLとは何ですか?

SWEET-RLは、Meta社が開発したマルチターン強化学習フレームワークで、特に協調推論タスク用の大規模言語モデル(LLM)エージェントのトレーニングを目的として設計されています。SWEET-RLは、追加のトレーニング情報(参照ソリューションなど)に基づいて「批評家」モデルを最適化し、各ステップで報酬を与えることで、「アクター」モデルがクレジットをより適切に配分し、ポリシーを最適化できるようにします。SWEET-RLはColBenchベンチマークで非常に優れたパフォーマンスを発揮し、バックエンドプログラミングとフロントエンドデザインタスクにおいて、他の最先端アルゴリズムと比較して成功率と勝率が6%向上しています。これにより、Llama-3.1-8Bモデルのパフォーマンスは、GPT-4oなどのトップモデルと同等、あるいはそれ以上となっています。

SWEET-RLの主な機能

  • 複数ターンのインタラクションタスクを最適化するSWEET-RLは、バックエンドプログラミングやフロントエンドデザインなど、複数回のやり取りを必要とする複雑なタスク向けに特化して最適化されています。
  • 効果的な信用配分トレーニング中に導入された追加情報(参照解など)に基づいて、各ステップに対して報酬が提供され、各アクションの価値が正確に評価され、複数ラウンドのタスクにおけるクレジット配分の問題が解決されます。
  • 複数のタスクタイプをサポート複雑なフロントエンド設計タスクの処理をサポートしており、さまざまなタスクタイプにおいてその汎用性と適応性を発揮します。

SWEET-RLの技術原理

  • トレーニング中の追加情報SWEET-RLは、学習中に参照解などの追加情報に基づいて「批評家」モデルを最適化します。批評家モデルは各ステップに対して報酬を与え、「行為者」モデルがより適切に報酬を配分できるよう支援します。
  • ブラッドリー=テリーのゴールSWEET-RLは、現在の状態における各行動の有効性を評価するBradley-Terry目的関数を用いて、アドバンテージ関数を直接学習します。これにより、現在の状態と行動の期待効用を予測するための価値関数の事前学習が不要になり、事前学習済みのLLMとの整合性が向上します。
  • 非対称情報構造非対称なアクター・クリティック構造に基づき、クリティックモデルはトレーニング中に付加情報にアクセスし、アクターモデルはインタラクション履歴にアクセスします。これにより、クリティックはアクションの価値をより正確に評価し、アクターはその評価に基づいて戦略を最適化することができます。
  • パラメータ化された利点関数アドバンテージ関数は各行動の平均対数確率としてパラメータ化され、軌跡レベルのブラッドリー・テリー目的関数に基づいて学習が行われます。このパラメータ化方法はLLMの事前学習目的関数とより整合性が高く、モデルの汎化能力を向上させます。

SWEET-RLプロジェクトの住所

SWEET-RLの応用シナリオ

  • テキスト校正これは、著者や編集者が記事中の誤字脱字や不適切な内容を迅速に修正するのに役立ちます。
  • ソーシャルメディアのモデレーションソーシャルメディアに投稿されるコンテンツが法令を遵守していることを確認し、個人または企業の評判を保護してください。
  • 広告コンプライアンス広告コピーを精査し、コンテンツの誤りによって生じる法的リスクや市場リスクを回避する。
  • 学術出版教材および学術論文の正確性と厳密性を確保するため。
  • マルチメディアコンテンツ検出動画、音声、画像を確認し、マルチメディアコンテンツが合法かつ法令遵守していることを確認してください。