project
HourVideo - Fei-Fei Li氏とJia-Jun Wu氏のチームによって開発された、長尺動画理解のためのベンチマークデータセット。
HourVideoは、スタンフォード大学のFei-Fei Li氏とJia-Jun Wu氏のチームが開発した、長尺動画理解のベンチマークデータセットです。20分から120分までの長さの500本の1人称視点動画が含まれており、77種類の日常活動を網羅し、マルチモーダルモデルの性能評価に利用できます。
HourVideoとは何ですか?
HourVideoは、スタンフォード大学のFei-Fei Li氏とJia-Jun Wu氏のチームが開発した、長尺動画理解のベンチマークデータセットです。20分から120分までの長さの、77種類の日常活動を捉えた一人称視点の動画500本を収録しています。このデータセットは、マルチモーダルモデルが長尺動画を理解する能力を評価するものです。要約、知覚、視覚的推論、ナビゲーションといった一連のタスクに基づき、動画内の複数の時間セグメントから情報を識別・統合するモデルの能力をテストすることで、長尺動画理解技術の発展を促進します。
HourVideoの主な機能
- 長尺動画の理解度評価HourVideoは、最大1時間までの動画に基づいて、モデルが長期的な視覚データストリームを理解する能力をテストできます。
- マルチタスクテストスイートこのデータセットには、要約、知覚、視覚的推論、ナビゲーションなど、さまざまなタスクが含まれており、動画言語理解のさまざまな側面におけるモデルのパフォーマンスを包括的に評価します。
- 質の高い質問生成: 標準化されたテスト問題を提供するために、人間のアノテーターと大規模言語モデル(LLM)によって生成された12,976の多肢選択問題。
- モデル性能比較他のマルチモーダルモデルと比較することで、長尺動画理解タスクにおける様々なモデルの性能を評価する。
HourVideoの技術原則
- ビデオデータセットの構築HourVideoは、Ego4Dデータセットから、日常の活動を捉えた一人称視点の動画500本を選定した。動画の長さは20分から120分まで様々である。
- タスクスイート設計複数のサブタスクを含むタスクスイートを設計する。各タスクでは、モデルがビデオコンテンツにおける長期的な依存関係を理解し、推論する必要がある。
- 問題プロトタイプの開発各課題について、正解するには動画の複数の時間セグメントから情報を識別し、統合する必要があるように、プロトタイプとなる問題が設計されている。
- データ生成プロセスビデオスクリーニング、質問生成、人間によるフィードバック最適化、ブラインドスクリーニング、専門家による最適化を含む多段階のデータ生成プロセスに基づいて、高品質の多肢選択式質問が生成されます。
HourVideoのプロジェクトアドレス
- arXiv技術論文:https://arxiv.org/pdf/2411.04998v1
HourVideoのアプリケーションシナリオ
- マルチモーダル人工知能研究長時間の連続動画コンテンツを理解するためのマルチモーダルモデルの研究開発。
- 自律エージェントおよびアシスタントシステム長期的な視覚情報を理解し、意思決定を行うことができる自律型エージェントや仮想アシスタントの開発を支援する。
- 拡張現実(AR)と仮想現実(VR)ユーザーの行動を理解し、それに応じて変化する没入型AR/VR体験を創造するための技術的基盤を提供する。
- 動画コンテンツ分析監視カメラ映像、ニュース報道、教育ビデオなどのビデオコンテンツを分析・理解し、重要な情報や知見を抽出する。
- ロボットビジョンロボットが長期的な視覚情報を理解し、複雑な環境におけるナビゲーション能力と操作能力を向上させることを可能にする。