AB
AiBoss
project

MMBench-Video - 上海AIラボと複数の大学が共同で立ち上げた、長尺動画理解のベンチマーク。

MMBench-Videoは、浙江大学、上海人工知能研究所、上海交通大学、香港中文大学が共同開発した、長尺動画と複数質問への回答に関する新しいベンチマークです。MMBench-Videoは、大規模な視覚的処理を包括的に評価できます。

MMBench-Videoとは何ですか?

MMBench-Videoは、浙江大学、上海人工知能研究所、上海交通大学、香港中文大学が共同開発した、長尺動画を用いた多項目質問応答型の新しいベンチマークです。MMBench-Videoは、豊富なコンテンツと詳細な能力評価を備えた長尺動画を用いることで、大規模視覚言語モデル(LVLM)の動画理解能力を包括的に評価し、既存のベンチマークが抱える時間的理解や複雑なタスク処理における課題を克服します。MMBench-Videoには、16のカテゴリを網羅する約600本のYouTube動画クリップが含まれており、各動画の長さは30秒から6分まで、ボランティアが作成した質の高い質問と回答のペアが付属しています。このベンチマークは、自動評価にGPT-4を使用することで、精度を向上させ、人間の判断との一貫性を維持しています。MMBench-Videoの登場により、研究者は動画言語モデルを評価・改善するための強力なツールを手に入れることができます。

MMBench-Videoの主な機能

  • 動画理解度評価MMBench-Videoは、大規模視覚言語モデル(LVLM)が長尺の動画コンテンツを理解する能力を評価するために使用されます。
  • マルチシナリオ対応このアプリには、幅広いテーマやシナリオを網羅した16の主要カテゴリのビデオコンテンツが含まれています。
  • 詳細な能力評価このモデルの動画理解能力は、26の細分化された能力指標を用いて包括的に評価される。
  • 高品質なデータセットデータ品質を確保するため、ビデオクリップと質疑応答の組み合わせは、ボランティアによって慎重に作成され、ラベル付けされた。
  • 自動評価評価の効率と精度を向上させるために、GPT-4を使用して自動評価を実施してください。

MMBench-Videoの技術的原理

  • 長尺動画コンテンツMMBench-Videoには、YouTubeから収集した複数の長尺動画クリップが含まれています。これらの動画クリップは、従来の短い動画よりも、モデルの時間的理解能力をより適切にテストできます。
  • 手動注釈質問と回答は、質の高さを確保し、偏りを減らすために、人間のボランティアによって作成およびラベル付けされています。
  • 能力分類システム私たちは、動画理解能力に関する3段階の分類システムを構築しました。このシステムは、知覚と推論という2つの主要なカテゴリと、さらに26のより詳細な能力次元から構成されています。
  • 時間推論チャレンジ動画コンテンツの時間的側面に対するモデルの理解度を評価するために、時間的推論能力を必要とする設計上の問題。
  • 自動評価言語モデル(GPT-4など)は、モデルの出力と標準的な回答との間の意味的な類似性を自動的に評価し、それによってモデルの性能を評価する。
  • 複数モデルの比較複数のLVLM(言語学習モデル)を採点・比較することで、動画理解タスクにおけるそれぞれの強みと弱みを判断するのに役立ちます。

MMBench-Videoプロジェクトのアドレス

MMBench-Videoの応用シナリオ

  • モデルの評価と比較研究者らは、知覚能力や推論能力を含む、動画理解における様々なLVLM(低次学習性運動ニューロン)の能力を評価し、比較した。
  • モデルの最適化とトレーニング開発者たちは、MMBench-Videoの評価結果に基づいてモデルのアーキテクチャとトレーニングプロセスを最適化し、モデルの動画コンテンツ理解能力を向上させた。
  • 学術交流と出版学術交流のためのツールとして、研究者が自身のモデルの性能を実証し、研究成果を学術会議や学術誌に発表するのに役立ちます。
  • マルチモーダル学習研究MMBench-Videoは、特に動画とテキストの理解を伴うタスクにおいて、マルチモーダル学習アルゴリズムの研究開発に役立つ豊富なデータセットを提供します。
  • インテリジェントなビデオ分析アプリケーションインテリジェントビデオ監視、コンテンツフィルタリング、自動要約、ビデオ推薦などの分野において、開発者がより精度の高いビデオ分析モデルを訓練・テストするのに役立ちます。