project
VideoChat-Flash - 上海AI研究所などが、長尺動画モデリングのためのマルチモーダル大規模モデルを発表。
VideoChat-Flashは、上海人工知能研究所と南京大学などが共同開発した、長尺動画モデリングのためのマルチモーダル大規模言語モデル(MLLM)です。このモデルは、階層型圧縮技術(HiCo)を用いて長尺動画を効率的に処理します。
VideoChat-Flashとは何ですか?
VideoChat-Flashは、上海人工知能研究所と南京大学などが共同開発した、長尺動画モデリングのためのマルチモーダル大規模言語モデル(MLLM)です。このモデルは、階層型圧縮技術(HiCo)を用いて長尺動画を効率的に処理し、重要な情報を保持しながら計算負荷を大幅に軽減します。また、短尺動画から長尺動画へと段階的に学習を進めるマルチステージ学習方式を採用し、実世界の長尺動画データセットであるLongVidと組み合わせることで、長尺動画の理解能力をさらに向上させています。
VideoChat-Flashの主な機能
- 長時間の動画を理解する能力VideoChat-Flashは、HiCo(Hi-Co圧縮)技術を用いて長時間の動画を効率的に処理し、数時間にわたる動画コンテンツにも対応可能です。「干し草の中の針」(NIAH)ミッションでは、オープンソースモデルとして初めて、10,000フレーム(約3時間分の動画)で99.1%の精度を達成しました。
- 高効率モデルアーキテクチャこのモデルは、各ビデオフレームをわずか16個のトークンにエンコードすることで計算量を大幅に削減し、推論速度を従来モデルより5~10倍高速化しています。さらに、マルチステージ方式の短尺動画から長尺動画への学習アプローチと、実世界の長尺動画データセットであるLongVidを組み合わせることで、モデルのパフォーマンスをさらに向上させています。
- 強力な動画理解機能VideoChat-Flashは、複数の長尺および短尺ビデオベンチマークテストにおいて非常に優れた性能を発揮し、他のオープンソースMLLMモデルを凌駕するだけでなく、一部のタスクではより大規模なモデルをも上回りました。
- マルチホップコンテキスト理解VideoChat-FlashはマルチホップNIAHタスクをサポートしており、長尺動画内の複数の関連画像シーケンスの追跡を可能にし、複雑なコンテキストを理解する能力をさらに向上させます。
VideoChat-Flashの技術的原理
- HiCo積層圧縮技術HiCoはVideoChat-Flashの中核となるイノベーションの一つであり、長時間の動画に含まれる冗長な視覚情報を効率的に処理するために設計されています。
- フラグメントレベル圧縮このプロセスでは、長い動画を短いセグメントに分割し、各セグメントを個別にエンコードします。
- ビデオレベルの圧縮セグメントエンコーディングに基づいて、動画全体のコンテキスト情報がさらに圧縮され、処理する必要のあるタグの数を削減します。
- 意味的関連付けの最適化ユーザーのクエリから得られる意味情報を組み合わせることで、不要な動画タグ付けをさらに削減でき、それによって計算負荷を軽減できる。
- 多段階学習プログラムVideoChat-Flashは、短い動画から長い動画へと段階的に学習を進める多段階学習アプローチを採用し、長い文脈を理解するモデルの能力を徐々に向上させていきます。
- 初期短い動画とその注釈を用いた教師あり微調整により、モデルの基本的な理解能力が構築される。
- 拡張段階より複雑な状況に対応できるようモデルを訓練するために、徐々に長時間の動画データを導入する。
- 混合コーパストレーニング最終的には、長さの異なる動画を包括的に理解するために、短い動画と長い動画の両方を含む混合コーパスを用いてトレーニングが行われます。
- LongVid 実世界の長尺動画データセットモデルのトレーニングを支援するため、研究チームは30万時間分の実際の長尺動画と2億語の注釈を含むLongVidデータセットを構築しました。このデータセットはモデルに豊富なトレーニングデータを提供し、長尺動画の理解タスクへの適応性を向上させます。
- モデルアーキテクチャVideoChat-Flashのアーキテクチャは、ビジュアルエンコーダー、ビジュアル言語コネクター、大規模言語モデル(LLM)という3つの主要部分で構成されています。この階層構造により、モデルはビデオコンテンツを効率的にコンパクトなトークンシーケンスにエンコードし、LLMを通して長文のコンテキストモデリングを実行できます。
VideoChat-Flashプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/OpenGVLab/VideoChat-Flash
- arXiv技術論文:https://arxiv.org/pdf/2501.00574
VideoChat-Flashのアプリケーションシナリオ
- 動画字幕の生成と翻訳このモデルは、詳細かつ正確な動画字幕を生成することができ、多言語翻訳やアクセシビリティ字幕の生成に適しており、視聴者が動画コンテンツをよりよく理解するのに役立ちます。
- ビデオQ&AとインタラクションVideoChat-Flashは、動画コンテンツに基づいた自然言語による質問応答をサポートしています。ユーザーは質問をすることで、映画のあらすじ分析やドキュメンタリーからの知識ポイントなど、動画から重要な情報を得ることができます。
- 身体化されたAIとロボット学習具現化されたAIの分野において、VideoChat-Flashは、ロボット自身の視点からの長時間の動画を通して、コーヒーを入れるといった複雑な作業を学習させるのに役立ちます。動画内の重要な出来事を分析することで、ロボットが作業を完了するように導くことができるのです。
- スポーツビデオの分析とハイライト映像の生成このモデルは、スポーツの試合動画を分析し、重要な出来事を抽出し、ハイライト映像を生成することで、視聴者が試合のエキサイティングな瞬間を素早く理解できるように支援します。
- 監視ビデオ分析VideoChat-Flashは、長時間の監視ビデオを処理し、重要なイベントを特定して追跡し、監視システムの効率と精度を向上させることができます。