project
Video-XL - 人工知能アカデミーと複数の大学が共同開発した、オープンソースの超長尺映像理解モデル。
Video-XLは、北京人工知能研究院、上海交通大学、中国人民大学、中国科学院、北京郵電大学、北京大学の研究者らが共同開発した、1時間にも及ぶ動画の理解に特化した超長時間視覚理解モデルです。
Video-XLとは何ですか?
Video-XLは、北京人工知能研究院(BAAI)、上海交通大学、中国人民大学、中国科学院、北京郵電大学(BUPT)、北京大学の研究者らが共同開発した、1時間にも及ぶ超長尺動画向けに設計された視覚理解モデルです。視覚コンテキスト潜在要約技術に基づき、視覚情報をコンパクトな形式に圧縮することで、処理効率を向上させ、情報損失を低減します。複数の長尺動画理解ベンチマークにおいて優れた性能を発揮し、例えばVNBenchでは既存の最先端手法よりも約10%高い精度を達成し、80GBのGPU1基で2048フレームの動画を処理する際には95%近い精度を実現しています。Video-XLは効率性とパフォーマンスのバランスに優れ、映画の要約、監視異常検知、広告配置認識といった長尺動画特有のタスクへの応用が期待されます。
Video-XLの主な機能
- 1時間単位の動画理解度Video-XLは非常に長い動画も処理でき、動画コンテンツを時間単位で理解することが可能です。
- 視覚的圧縮視覚コンテキスト潜在要約技術に基づき、大量の視覚情報をよりコンパクトな形式に圧縮し、モデルの処理能力に適応させる。
- 高効率コンピューティング高い精度を維持しながら、コンピューティングリソースの消費量を削減し、単一のGPUで多数のビデオフレームを処理することが可能です。
- マルチモーダルデータ処理単一画像、複数画像、動画など、さまざまなデータタイプを処理できます。
- 長時間の動画に特化したタスク処理映画の要約、異常検知の監視、広告配置の認識など、長尺動画に関連する特定のタスクに適しています。
Video-XLの技術原理
- 視覚的コンテキスト潜在要約: ビジュアルサマリータグ (VST) を導入し、元の視覚コンテキスト (自己注意モジュールのキーと値など) の活性化を非常にコンパクトな表現に圧縮します。
- ブロック処理ビジュアルマーカーシーケンスは同じサイズのブロックに分割され、各ブロックにVSTが挿入され、LLMを使用してビジュアル信号が段階的に圧縮されます。
- 自己回帰法各ブロックのエンコード中、Video-XLは追加の投影マトリックスを使用することに加えて、すべてのモジュールを再利用してVSTの隠し状態を変換し、視覚信号の情報を圧縮してVSTのアクティベーションに変換します。
- 統一ビジュアルコーディングスキームこれは、単一画像、複数画像、および動画を同じ空間にエンコードすることで、さまざまなマルチモーダルデータを処理します。
- 長尺動画データセット(VICO): 長尺動画や動的な視覚的コンテキストを処理するために特別に設計された新しい長尺動画データセットを開発し、モデルの長尺動画理解能力を向上させる。
Video-XLのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/VectorSpaceLab/Video-XL
- ハギングフェイスモデルライブラリ:https://huggingface.co/sy1998/Video_XL
- arXiv技術論文:https://arxiv.org/pdf/2409.14485
Video-XLの応用事例
- 映画およびビデオコンテンツの概要Video-XLは、映画やテレビシリーズの主要な筋書きや出来事など、長尺の動画コンテンツを理解して要約し、ユーザーに簡潔な概要を提供することができます。
- ビデオ監視分析セキュリティ監視の分野では、監視ビデオにおける異常な事象や異常な活動を特定するための異常行動検出に用いられる。
- 広告掲載と分析Video-XLは、動画コンテンツにおける広告配置の効果を分析し、広告と動画コンテンツの関係性、そして視聴者の広告に対する反応を理解するのに役立ちます。
- 教育・研修ビデオ教育分野では、Video-XLは長時間の授業動画を理解し要約するために使用され、学生がコースの要点を素早く把握するのに役立ちます。
- 動画コンテンツの取得Video-XLは、ビデオデータベース内のコンテンツ検索に使用され、ユーザーがビデオ内の重要な部分や関連情報を迅速に見つけるのに役立ちます。