AB
AiBoss
project

WorldPM - アリババのQwenチームと復旦大学が共同で開発した、一連の嗜好モデリングモデル。

WorldPM(World Preference Modeling)は、アリババグループのQwenチームと復旦大学が開発した一連の選好モデリングモデルです。大規模なトレーニングを通じて選好モデルのスケーラビリティを明らかにします。このモデルは1500万件のデータに基づいています。

WorldPMとは何ですか?

WorldPM(World Preference Modeling)は、アリババグループのQwenチームと復旦大学が開発した一連の選好モデリングモデルです。大規模なトレーニングを通じて選好モデルのスケーラビリティを明らかにします。このモデルは1500万の選好データポイントでトレーニングされ、選好モデルは客観的領域では明確なべき乗則減少傾向を示す一方、主観的領域では多次元性のため単一のスケーラビリティ傾向を示すのが難しいことが分かりました。このプロジェクトでは、72Bサイズのベースモデルと、特定のデータセットに合わせて微調整された複数のバージョンを提供しています。WorldPM-72B-HelpSteer2は、正確な選好判断を必要とする特定のタスクに適しており、WorldPM-72B-UltraFeedbackは大規模なユーザーフィードバックシナリオの処理に適しており、WorldPM-72B-RLHFLowは、リソースが限られた選好モデリング向けに設計されており、データが限られたシナリオに適しています。Hugging Facesに基づく迅速な展開をサポートしています。 WorldPMは、自然言語処理における対話システムや推薦システムなどのタスク向けに強力な嗜好モデリング機能を提供し、関連分野の発展に貢献する。

世界首相の主な機能

  • 選好モデリング人間の嗜好パターンを学習し、統一された嗜好表現を形成する。
  • 一般化能力を向上させる: さまざまなデータセットにおいて、モデルのパフォーマンス向上に役立ちます。
  • 基本モデルとしてモデルのパフォーマンスを向上させるための、設定の微調整に使用されます。
  • 堅牢性を向上させるエラーや不完全な情報を特定し、処理する。

WorldPMの技術的原則

  • 嗜好データの収集と処理WorldPMは、StackExchangeやRedditなどの公開フォーラムからユーザーが生成した嗜好データを収集します。このデータは、ユーザーがさまざまな回答に対して投票する仕組みに基づいて、自然に嗜好のペアを形成します。
  • 大規模トレーニングと規模の法則WorldPMは、モデルパラメータのサイズとトレーニングデータ量の増加に伴ってモデル性能が向上するという、言語モデリングのスケーリング法則を応用しています。WorldPMは、様々なサイズ(15億から720億パラメータ)のモデルでトレーニングを行うことで、選好モデリングのスケーリングの可能性を探ります。実験結果は、敵対的評価タスクと客観性評価タスクの両方において、トレーニングデータとモデルサイズの増加に伴ってモデル性能が大幅に向上することを示しています。
  • 選好モデリングフレームワークWorldPMは、二値選好ペアに基づくモデリングフレームワークです。選好サンプルの各ペアについて、モデルは各回答に対する報酬スコアを計算し、ブラッドリー・テリーモデルに基づいてBT損失関数を最適化することで、選好パターンを学習します。
  • スタイルの好み分析と制御主観的な嗜好評価におけるスタイル嗜好の問題に対処するため、スタイル嗜好分析および制御メカニズムを導入する。スタイル特性(テキストの長さ、Markdown形式など)をコンテンツ特性から分離することで、モデルは嗜好をより正確に評価し、スタイル要因が評価結果に及ぼす影響を軽減することができる。
  • モデルの拡張と微調整WorldPMは、嗜好評価に直接使用することも、他のモデルの初期化ベースとして使用して嗜好をさらに微調整することもできます。WorldPMは、さまざまなサイズの人間嗜好データセットで微調整を行うことで、モデルのパフォーマンスをさらに向上させることができ、特にデータが限られている場合に顕著なパフォーマンス向上を示します。

WorldPMのプロジェクトアドレス

WorldPMの応用事例

  • 言語生成最適化AIが生成するテキストをより自然で人間の好みに沿うものにするため、例えばチャットボットの応答の質を向上させるなど。
  • パーソナライズされたおすすめ情報記事、動画、音楽など、ユーザーの好みに基づいたコンテンツを推奨することで、推奨の精度と満足度を向上させます。
  • インテリジェントな顧客サービスの改善これは、インテリジェントな顧客サービスがユーザーのニーズをより深く理解し、ユーザーの期待によりよく応える応答を生成し、ユーザーエクスペリエンスを向上させるのに役立ちます。
  • コンテンツのモデレーションとセキュリティ誤った情報や有害な情報を識別して排除することで、コンテンツの安全性と信頼性を確保します。
  • マルチモーダルアプリケーション画像や動画などのマルチモーダルコンテンツの嗜好モデリングに拡張し、コンテンツの生成とモデレーションを最適化する。