AB
AiBoss
project

LongVU - Meta AIのオープンソース長尺動画理解モデル

LongVUは、Meta AIチームが開発した、時空間適応型圧縮メカニズムに基づく長尺動画理解モデルです。大規模言語モデル(LLM)のコンテキストサイズによって制限される長尺動画の処理という課題に取り組んでいます。LongVUは、クロスモーダルクエリに基づいており、...

LongVUとは何ですか?

LongVUは、Meta AIチームが開発した、時空間適応型圧縮メカニズムに基づく長尺動画理解モデルです。大規模言語モデル(LLM)のコンテキストサイズによって制限される長尺動画の処理という課題に取り組んでいます。LongVUは、クロスモーダルクエリとフレーム間の依存関係に基づいて、動画タグの数を削減しながら長尺動画の視覚的な詳細を保持します。LongVUは、DINOv2の特徴量を使用して類似性の高い冗長なフレームを削除し、テキスト誘導型のクロスモーダルクエリを使用して選択的なフレーム特徴量を削減し、必要に応じて時間的依存関係に基づいて空間タグ圧縮を実行します。LongVUは、与えられたコンテキスト長内で視覚情報の損失を最小限に抑えながら、多数のフレームを効率的に処理できます。

LongVUの主な機能

  • 時空間適応圧縮LongVUは、動画タグの数を減らし、動画内の重要な視覚的詳細を保持することで、長尺動画を処理し、限られたコンテキスト長内で非常に長い動画コンテンツを処理できます。
  • クロスモーダルクエリテキスト誘導型クロスモーダルクエリは、ビデオフレームの特徴を選択的に削減し、テキストクエリに最も関連性の高いフレームの詳細情報を保持しつつ、他のフレームを低解像度のタグ付き表現に縮小します。
  • フレーム間依存関係の悪用LongVUは、ビデオフレーム間の時間的依存関係の分析に基づいて、依存関係に基づいた空間タグ圧縮を実行し、モデルのコンテキスト長要件を削減することができます。
  • 長尺動画の理解LongVUは、1fpsでサンプリングされたビデオ入力を効果的に処理でき、1時間にも及ぶビデオのフレームあたりの平均タグ数を2に適応的に削減し、8kのコンテキスト長を持つマルチモーダル大規模言語モデル(MLLM)に対応できます。

LongVUの技術原則

  • 時間圧縮戦略DINOv2の機能を使用して、非常に類似した冗長なビデオフレームを識別して削除し、ビデオの時間的次元における冗長性を低減します。
  • 選択性の低下テキスト誘導型クロスモーダルクエリでは、テキストクエリに関連するフレームについては完全なトークンが保持され、その他のフレームには空間プーリングが適用されて空間次元の冗長性が低減されます。
  • 空間タグ圧縮非常に長い動画の場合、LongVUはフレーム間の時間的依存関係に基づいて空間ラベルをさらに圧縮します。フレーム間の空間ラベルの類似性を計算することで、最初のフレームと類似しすぎる後続フレームの空間ラベルが削除され、モデルが処理する必要のあるデータ量が削減されます。
  • マルチモーダルトレーニングLongVUは、大規模なビデオとテキストのペアを用いてトレーニングを行い、画像と言語の事前学習とビデオと言語の微調整を組み合わせることで、ビデオ理解タスクにおけるモデルのパフォーマンスを向上させます。

LongVUのプロジェクトアドレス

LongVUの応用シナリオ

  • 動画コンテンツ分析LongVUは、長時間の動画コンテンツを分析し、監視カメラ映像、ニュース報道、ドキュメンタリーなどから重要な出来事や場面を特定するなど、主要な情報を抽出するために使用されます。
  • 動画の検索とインデックス作成LongVUは、動画コンテンツに関する独自の知見に基づき、動画検索エンジンの構築を支援することで、ユーザーがテキスト検索を用いて動画内の関連部分を素早く見つけられるようにする。
  • 動画コンテンツの生成LongVUは、動画コンテンツの説明、要約、または字幕を生成するために使用され、動画コンテンツのアクセシビリティとアクセス性を向上させます。
  • ビデオQ&AシステムLongVUは、動画に関する質疑応答システムの構築をサポートしており、ユーザーは動画コンテンツについて質問することができ、システムはその質問を理解して正確な回答を提供することができます。
  • 教育と訓練教育分野では、LongVUは授業動画の分析、重要な教育ポイントの抽出、そして学生が授業内容をより深く理解し習得できるよう支援するために活用されています。