AB
AiBoss
project

R1-Omni - Alibaba Tongyi がオープンソース化したマルチモーダル大規模言語モデル

R1-Omniは、アリババ同義が発表した強化学習(RLVR)に基づくマルチモーダル言語モデルで、感情認識タスクに特化しています。視覚情報と音声情報を組み合わせることで、感情認識の推論プロセスを明確に説明し、…

R1-Omniとは何ですか?

Alibaba Tongyiが開発したR1-Omniは、強化学習(RLVR)に基づくマルチモーダル言語モデルであり、感情認識タスクに特化しています。視覚情報と音声情報を組み合わせることで、感情認識の推論プロセスを明確に説明し、強力な感情理解能力を発揮します。複数の感情認識データセットにおいて、R1-Omniは教師ありファインチューニング(SFT)モデルを大幅に上回り、分布外シナリオでも優れた性能を発揮し、高い汎化能力を備えています。

R1-Omniの主な機能

  • マルチモーダル感情分析R1-Omniは、視覚情報と音声情報を同時に処理することができ、入力されたビデオまたは音声コンテンツに対して感情認識を行い、そこに表現されている感情を正確に判断します。
  • 説明可能な推論プロセスこのモデルは感情認識結果を提供するとともに、詳細な推論プロセスを生成します。この推論プロセスは特定のラベルにカプセル化されており、モデルが視覚情報と聴覚情報をどのように統合して予測を行うかを説明することで、モデルの解釈性を向上させています。
  • RLVRに基づいたトレーニングR1-OmniはRLVRトレーニングパラダイムを採用しており、別途報酬モデルに頼ることなく、検証可能な報酬関数に基づいて出力を直接評価します。これにより、報酬メカニズムが簡素化されるとともに、タスク本来の正しさの基準との一貫性が確保されます。
  • GRPO法の適用生成相対方策最適化(GRPO)手法を組み合わせることで、生成された応答グループを直接比較することができ、追加の批評モデルを使用する必要がなくなり、高品質な出力と低品質な出力を区別するモデルの能力が向上します。
  • 推論能力の向上他のベースラインモデルと比較して、R1-Omniはより一貫性があり、正確で、解釈しやすい推論プロセスを提供する。
  • 理解度の向上複数の感情認識データセットにおいて、R1-Omniは感情認識精度において他のモデルを大幅に上回る性能を発揮する。
  • より強い一般化能力分布外データセット(OODデータセット)においては、R1-Omniは優れた性能を発揮し、未知のシナリオにもより適応しやすい。

R1-Omniの技術原理

  • RLVRトレーニングパラダイムRLVRは斬新な学習パラダイムです。その核心となるアイデアは、検証関数に基づいてモデルの出力を直接評価することであり、従来の人間によるフィードバックに基づく強化学習(RLHF)における報酬モデルを別途用意する必要性をなくします。入力問題qが与えられると、方策モデルπθは応答oを生成し、これは検証可能な報酬関数R(q,o)を用いて評価されます。最適化の目的は、検証報酬からKLダイバージェンスに基づく正則化項を差し引いた値を最大化することです。これにより、報酬メカニズムが簡素化されるとともに、タスク本来の正しさの基準との整合性が確保されます。
  • GRPO法GRPO(Grouped Relative Policy Optimization)は、従来のPPO(Proximal Policy Optimization)とは異なり、強化学習手法を改良したものです。GRPOは追加の批評モデルを使用せず、生成された応答グループを直接比較します。具体的には、問題qに対して、複数の出力グループ{o1​,o2​,…,oG​}がサンプリングされ、各出力に対して報酬スコア{r1​,r2​,…,rG​}が計算され、これらの報酬スコアが正規化されて相対報酬が形成されます。これにより、同じ問題に対する異なる出力の相対的なメリットがより直接的に反映され、モデルが高品質な出力と低品質な出力を区別する能力が向上します。
  • コールドスタート戦略R1-Omniモデルは、DeepSeek-R1にヒントを得たコールドスタート戦略を用いて構築されました。まず、HumanOmni-0.5Bは、Explainable Multimodal Sentiment Inference(EMER)データセットの232サンプルと、HumanOmniデータセットの手動でラベル付けされた348サンプルを組み合わせたデータセットでファインチューニングされました。これにより、モデルは予備的な推論能力を獲得し、視覚的および聴覚的な手がかりが感情認識にどのように影響するかを理解できるようになりました。その後、RLVRトレーニングによってモデルはさらに最適化されました。
  • 報酬関数設計RLVRの学習において、報酬関数は精度報酬とフォーマット報酬の2つの部分から構成されます。精度報酬は予測された感情と実際の感情との一致度を評価し、フォーマット報酬はモデルの出力が指定されたHTMLタグ形式に準拠していることを保証します。これにより、感情認識の精度と出力の解釈可能性が確保されます。
  • モデル出力形式R1-Omniの出力は、推論プロセスと最終的な感情ラベルの2つの部分から構成されることが想定されています。推論プロセスは`<think></think>`タグ内に記述され、モデルが視覚情報と音声情報を統合して予測を行う方法を説明します。最終的な感情ラベルは`<answer></answer>`タグ内に記述され、予測された感情を表します。感情認識結果と詳細な推論プロセスを提供することで、モデルの解釈性が向上します。

R1-Omniプロジェクトの住所

R1-Omniの応用シナリオ

  • 感情分析これは、ソーシャルメディア管理、世論調査、消費者感情分析などのシナリオで使用でき、企業がターゲットユーザーとより効果的にコミュニケーションを取るのに役立ちます。
  • コンテンツ作成支援AIによる描画ツールと書き込みツールを組み合わせることで、マーケティング、広告制作などにおいて高品質なソリューションを提供します。
  • 精神保健評価R1-Omniは患者の感情表現を分析することができ、精神保健専門家による評価や介入を支援する。
  • 教育オンライン教育において、R1-Omniは生徒の感情的な反応を分析し、教師が指導戦略を調整するのに役立ちます。