AB
AiBoss
project

HumanOmniV2 - Alibaba Tongyiがオープンソース化したマルチモーダル推論モデル

HumanOmniV2は、アリババ傘下のTongyi Labが開発したオープンソースのマルチモーダル推論モデルです。このモデルは、強制的な文脈要約メカニズム、大規模モデル駆動型の多次元報酬システム、およびGRPOベースの最適化トレーニング手法に基づいて、マルチモーダル推論の課題に取り組んでいます。

HumanOmniV2とは何ですか?

HumanOmniV2は、アリババ傘下のTongyi Labが開発したオープンソースのマルチモーダル推論モデルです。強制的なコンテキスト要約メカニズム、大規模モデル駆動型の多次元報酬システム、GRPOベースの最適化学習手法に基づき、マルチモーダル推論におけるグローバルなコンテキスト理解の不足や推論経路の単純化といった課題を解決します。モデルは回答を生成する前に、視覚、聴覚、言語信号を体系的に分析して完全なシーン背景を構築し、マルチモーダル情報の中に隠された論理や深い意図を正確に捉えます。HumanOmniV2はIntentBenchなどのベンチマークテストで69.33%という高い精度を達成し、AIが複雑な人間の意図を理解するための重要な参考資料となっています。本モデルは現在、研究および応用向けにオープンソースとして公開されています。

HumanOmniV2の主な機能

  • マルチモーダル情報の包括的な理解画像、動画、音声など様々な入力形式から得られる視覚、聴覚、言語信号を包括的に分析し、隠された情報や深い論理構造を捉えます。
  • 人間の意図を正確に推論する文脈を体系的に分析することで、複雑な感情、社会的関係、潜在的な偏見などを含め、対話やシナリオにおける真の意図を正確に理解する。
  • 構造化された推論パスを生成する推論プロセス中、モデルはコンテキストと推論手順の詳細な要約を出力するため、推論プロセスが透明性があり、解釈可能であることが保証されます。
  • 複雑な社会状況への対処複雑な社会的相互作用において、人々の感情、行動の動機、社会的関係を特定し理解することで、人間の認知により合致した判断を下す。

HumanOmniV2の技術的原理

  • 強制的な文脈要約メカニズム最終的な回答を生成する前に、モデルは`<context>`タグ内にコンテキストの要約を出力し、マルチモーダル入力の重要な情報が見落とされないようにします。この構造化された設計により、モデルは視覚、聴覚、言語信号を体系的に分析し、完全なシーンコンテキストを構築することができます。
  • 大規模モデルによって駆動される多次元報酬システム文脈報酬は、マルチモーダル入力の全体的な文脈を理解するモデルの精度を評価します。フォーマット報酬は、モデルの出力が構造化された要件に準拠していることを保証します。精度報酬は、質問への回答におけるモデルの正確性を向上させます。論理報酬は、モデルが反射、帰納、演繹などの高度な推論手法を使用するよう促し、単純なテキスト推論への依存を回避します。
  • GRPOに基づく最適化トレーニング方法
    • 単語レベルの損失を導入する(トークンレベル損失):長いシーケンスのトレーニングにおける不均衡問題を解決します。
    • 問題レベルの正規化用語を削除する難易度の異なるサンプル間の重み付けの偏りを避けるため。
    • 動的KLダイバージェンス機構の適用トレーニングの初期段階では探索を促し、後期段階では安定した収束を実現することで、モデルの汎化能力とトレーニングの安定性を向上させる。
  • 高品質なフルモーダル推論トレーニングデータセット画像、動画、音声タスクを含む高品質なデータセットを構築し、詳細なコンテキスト要約と推論パスの注釈を付加することで、モデルのコールドスタートトレーニングと強化学習のための強固な基盤を提供します。
  • 新しいベンチマークであるIntentBenchこのテストには633本の動画と、動画内の聴覚的および視覚的な手がかりと密接に関連した2,689の関連質問が含まれており、人間の行動動機、感情状態、および社会的相互作用を深く理解するモデルの能力を評価することに重点を置いています。

HumanOmniV2プロジェクトのアドレス

  • GitHubリポジトリ:https://github.com/HumanMLLM/HumanOmniV2
  • ハギングフェイスモデルライブラリ:https://huggingface.co/PhilipC/HumanOmniV2
  • arXiv技術論文:https://arxiv.org/pdf/2506.21277

HumanOmniV2の応用事例

  • 動画コンテンツの理解と推奨動画内の感情、登場人物間の関係性、背景シーンを分析することで、動画プラットフォーム向けに正確なコンテンツ推奨を提供し、ユーザーが自身の興味や感情により合致した動画を見つけられるように支援します。
  • インテリジェントな顧客サービスと顧客体験の最適化音声とテキストを通じて顧客の感情やニーズを分析することで、顧客サービスシステムにリアルタイムのフィードバックを提供し、顧客サービス担当者が顧客の問題に適切に対応し、顧客満足度を向上させるのに役立ちます。
  • 感情認識とメンタルヘルスサポート声のトーン、表情、言語内容を組み合わせることで、ユーザーの感情状態を特定し、メンタルヘルスアプリケーションがより正確な感情的なサポートや介入の提案を提供できるよう支援する。
  • 社会的相互作用の分析と最適化ソーシャルメディアプラットフォーム上のインタラクティブなコンテンツを分析して、潜在的な誤解や衝突を特定し、ソーシャルレコメンデーションやユーザーインタラクション体験を最適化し、ソーシャルメディアプラットフォームの調和を向上させる。
  • 教育と個別学習その目的は、学習過程における生徒の感情や行動を分析し、オンライン教育プラットフォーム向けに個別の学習提案を提供し、教師が学習成果を向上させるために教育内容と方法を最適化できるよう支援することである。