AB
AiBoss
project

OThink-MR1 - OPPOと香港科技大学が共同開発したマルチモーダル言語モデル最適化フレームワーク

OThink-MR1は、OPPO研究所と香港科技大学(広州)が共同開発したマルチモーダル言語モデル最適化フレームワークです。Kullback-Leibler(KL)ダイバージェンスポリシー(GRPO-D)と報酬モデルを動的に調整することで、…

OThink-MR1とは何ですか?

OThink-MR1は、OPPO研究所と香港科技大学(広州)が共同開発したマルチモーダル言語モデル最適化フレームワークです。Kullback-Leibler(KL)ダイバージェンスポリシー(GRPO-D)と報酬モデルを動的に調整することで、複雑なタスクにおけるマルチモーダルモデルの汎化推論能力を向上させます。OThink-MR1は、視覚的計数や幾何学的推論などのマルチモーダルタスクにおいて優れた性能を発揮し、同一タスク検証では従来の教師ありファインチューニング(SFT)手法を凌駕し、タスク間汎化実験では高い適応性を示します。OThink-MR1は、マルチモーダルモデルにおける汎用推論能力開発の新たな道を切り開き、今後さらに多くの分野で重要な役割を果たすことが期待されます。

OThink-MR1の主な機能

  • マルチモーダルタスクのパフォーマンスを向上させる動的強化学習最適化モデルに基づき、マルチモーダルタスク(視覚的計数、幾何学的推論など)の精度と汎化能力を大幅に向上させる。
  • タスク横断的な一般化能力その目的は、ある種類のマルチモーダルタスクで訓練されたモデルを、他の異なる種類のマルチモーダルタスクに効果的に転用できるようにすることで、特定のタスクに特化したデータへの依存度を低減することである。
  • 動的平衡の探求と活用トレーニング中は、新しい戦略を探求することと既存の経験を活用することのバランスが動的に調整され、モデルの全体的な最適化能力が向上します。
  • モデルの推論能力を向上させる報酬モデルに基づいて、モデルは正確でフォーマットされた出力を生成するように誘導され、それによって全体的な推論能力が向上します。

OThink-MR1の技術原理

  • 動的KLダイバージェンス戦略(GRPO-D)GRPO-D戦略は、古典的な強化学習におけるε-greedy戦略に着想を得ており、「早期探索、後期活用」の原則に基づいています。この戦略は、KLダイバージェンスの重みを動的に調整することで、トレーニング中のモデルの探索(新しい戦略の試行)と活用(既存の経験の利用)のバランスを取ります。トレーニングの初期段階では、KLダイバージェンスの重みは小さく、モデルが広範囲に探索することを促します。トレーニングが進むにつれて、重みは徐々に増加し、モデルが蓄積された経験を活用するように導き、最適解ではない解への早期収束を回避します。
  • 報酬モデルモデルの出力精度を評価します。例えば、視覚的なカウントタスクにおいて、モデルの出力が実際のカウントとどの程度一致するかなどを確認します。また、モデルの出力が特定のフォーマット要件に準拠していることを確認します。例えば、幾何学的推論タスクにおいて、モデルの出力フォーマットが正しいかどうかなどを確認します。検証精度報酬とフォーマット報酬を組み合わせることで、モデルにより包括的なフィードバックを提供し、学習プロセスを円滑に進めることができます。
  • 強化学習の最適化報酬関数を最大化することに基づいて、モデルの戦略が最適化されます。各トレーニングステップにおいて、モデルは現在の戦略に従って出力を生成し、報酬モデルは出力の品質を評価し、モデルは報酬信号に応じて戦略を調整して、徐々にパフォーマンスを向上させます。

OThink MR1プロジェクトの住所

OThink-MR1の応用シナリオ

  • インテリジェントな視覚的質問応答画像の内容を正確に理解し、複雑なシーン内の物体の数を識別するなど、回答を生成する。
  • 画像の説明生成豊富で正確な画像説明を生成し、より詳細な視覚情報を提供します。
  • 幾何学問題を解く画像内の幾何学的形状を分析し、角度や長さなどの幾何学的特性を計算します。
  • マルチモーダルなコンテンツモデレーション画像情報とテキスト情報を組み合わせることで、コンテンツが規制に準拠しているかどうかを判断し、審査効率を向上させることができます。
  • 仮想現実と拡張現実リアルタイムのシーン解釈やナビゲーション提案など、ユーザーにインテリジェントなインタラクティブ体験を提供します。