AB
AiBoss
project

Vidi2 - ByteDanceが発表したマルチモーダル動画理解・生成モデル

Vidi2は、ByteDanceが開発したマルチモーダルな大規模言語モデルで、動画の理解と作成に特化しています。マルチモーダルな時間的検索(TR)において業界トップクラスの性能を達成しており、時空間的位置特定(STG)や動画質問応答(Video QA)においても優れた性能を発揮します。

Vidi2とは何ですか?

Vidi2は、ByteDanceが開発したマルチモーダルな大規模言語モデルで、動画の理解と作成に特化しています。マルチモーダルな時間検索(TR)において業界トップクラスの性能を達成し、時空間位置特定(STG)と動画質問応答(Video QA)においても大きな進歩を遂げています。テキストクエリに基づいて、Vidi2は動画内の対応するタイムスタンプを識別するだけでなく、対象オブジェクトのバウンディングボックスもマークできます。Vidi2は、STG機能をより適切に評価するための新しいベンチマークであるVUE-STGとVUE-TR-V2を導入しました。実用的なアプリケーションでは、Vidi2はインテリジェント編集、インテリジェントシーン構成、インテリジェント字幕などの機能をサポートし、クリエイターがより効率的に動画を作成できるよう支援します。

Vidi2の主な機能

  • 動画の理解と検索数時間にも及ぶ動画を処理し、テキストクエリに基づいて動画内の関連時間帯を迅速に特定し、複雑なシナリオにおける長時間の動画の理解をサポートすることができます。
  • 時空間測位(STG)この技術は、動画内のタイムスタンプを識別するだけでなく、これらの時間帯における対象物の境界ボックスをマークすることで、正確な時空間位置特定を実現します。
  • ビデオQ&A動画による質問応答タスクをサポートし、動画コンテンツに基づいてユーザーの質問に答えることができ、より包括的なマルチモーダル推論機能を提供します。
  • インテリジェントな作成ツール自動編集、インテリジェントなシーン分割、インテリジェントな字幕など、複数の機能をサポートしており、クリエイターが長い動画をTikTokなどのプラットフォームに適した短い動画に素早く変換するのに役立ちます。
  • マルチビュー切り替えとインテリジェントな再構築グラフ動画の視覚効果を向上させるため、自動マルチビュー切り替え機能と、構図を考慮したインテリジェントな再選択およびトリミング機能をサポートしています。

Vidi2の技術原則

  • マルチモーダル融合Vidi2は、視覚エンコーダー(ビデオフレームやクリップを処理するために使用される)と大規模な言語モデルを組み合わせ、指導による微調整と整合を通じて、統合された長尺ビデオの理解および表現能力を形成します。
  • 時空間測位(STG)Vidi2は、時空間位置特定技術を用いて、テキストクエリに基づいて動画内の対象オブジェクトの関連タイムスタンプとバウンディングボックスを正確に特定します。動画の時空間情報は、マルチモーダル特徴抽出と類似度計算に基づく深層学習モデル(Transformerなど)を用いて処理されます。
  • 動画の理解と検索Vidi2は、マルチモーダルなテキスト・ビデオ検索技術を用いて、テキストデータとビデオデータをベクトル表現に変換し、類似度計算(コサイン類似度など)によってテキスト・ビデオ検索を実現します。特徴抽出と深層学習技術により、ビデオコンテンツの構造化分析を行い、効率的なビデオ検索を可能にします。
  • 多粒度時間モデリングVidi2は、マルチグレイン時間モデリング技術を採用しており、単一フレームから長尺ビデオクリップまで、さまざまな時間スケールで情報を処理できます。メモリおよび検索メカニズム(スライディングウィンドウ+メモリトークン/検索機能強化など)と組み合わせることで、長尺ビデオの効率的な理解と検索を実現します。
  • 異種モダリティ間の連携Vidi2は、クロスモーダルアライメント技術を用いて、動画内の視覚情報、音声情報、テキスト情報を効果的に整合させることで、動画コンテンツのより包括的な理解を実現します。

Vidi2プロジェクトの住所

  • プロジェクト公式サイト:https://bytedance.github.io/vidi-website/
  • GitHubリポジトリ:https://github.com/bytedance/vidi
  • arXiv技術論文:https://arxiv.org/pdf/2511.19529

Vidi2のアプリケーションシナリオ

  • インテリジェントなビデオ編集長尺動画からハイライト部分を自動的に抽出し、短尺動画プラットフォームに適したコンテンツを生成することで、制作効率を向上させます。
  • ビデオQ&A動画コンテンツに基づいてユーザーの質問に答えることで、動画コンテンツとのインタラクティブなユーザー体験を向上させる。
  • 時空間位置情報に基づく編集動画内の時間とオブジェクトを正確に特定することで、マルチビュー切り替えや画像のインテリジェントな再構築といった複雑な編集作業をクリエイターが行うのに役立ちます。
  • 自動字幕生成動画の字幕を自動生成することで、動画のアクセシビリティとユーザーエクスペリエンスを向上させます。
  • コンテンツ作成支援これは、クリエイターがシンプルなプロンプトやテーマを、タイトル、フック、ストーリーボードを含む完全なビデオスクリプトに変換するのに役立ちます。