AB
AiBoss
project

SlowFast-LLaVA-1.5 - Appleのマルチモーダル長尺動画理解モデル

SlowFast-LLaVA-1.5(略称SF-LLaVA-1.5)は、長時間の動画理解のために特別に設計された高効率な動画言語モデルです。2ストリーム(SlowFast)メカニズムに基づいて、より多くの入力フレームを処理することと、フレームあたりのトークン数を削減することのバランスを取っています。

SlowFast-LLaVA-1.5とは何ですか?

SlowFast-LLaVA-1.5(略称SF-LLaVA-1.5)は、長尺動画の理解に特化した高効率動画言語モデルです。2ストリーム(SlowFast)メカニズムに基づき、入力フレーム数の増加とフレームあたりのトークン数の削減、詳細な空間特徴の捕捉、そして長期的な時間的動き情報の効率的な処理を両立させています。本モデルは、簡略化された2段階の学習プロセスと高品質な公開データセットを用いて学習された、パラメータサイズが1Bから7Bまでのモデルで構成されています。長尺動画の理解タスクにおいて卓越した性能を発揮し、画像理解タスクにおいても高いパフォーマンスを維持するとともに、小規模モデルでも大きなメリットを示し、軽量かつモバイルフレンドリーな動画理解アプリケーションを強力にサポートします。

SlowFast-LLaVA-1.5の主な機能

  • 高効率な長尺動画理解長時間の動画に含まれる複雑な時空間情報を効率的に処理し、長時間の時間的文脈を捉えることができ、長時間の動画コンテンツの理解と分析に適している。
  • マルチモーダル融合この技術は、動画と画像の入力を組み合わせることで包括的な視覚理解能力を提供し、動画と画像のタスクの共同学習をサポートし、様々な視覚タスクにおけるモデルのパフォーマンスを向上させます。
  • 軽量でモバイルフレンドリーこのモデル設計は軽量設計を重視しており、モバイルデバイスなどのリソース制約のある環境への展開に適しており、エッジコンピューティングやリアルタイムアプリケーションのニーズを満たす。
  • 優れた推論能力大規模言語モデル(LLM)のアーキテクチャに基づいており、強力な自然言語処理能力を備え、動画コンテンツの詳細な説明を生成したり、動画に関連する質問に答えたりすることができます。
  • 拡張性本システムは、1Bから7Bまでのパラメータサイズを持つモデルを提供しており、ユーザーはそれぞれのニーズに基づいて適切なモデルサイズを選択できるため、パフォーマンスとリソースのバランスを取ることができます。

SlowFast-LLaVA-1.5の技術的原理

  • スローファストデュアルストリーム機構
    • 流れが遅い低フレームレートでビデオを処理し、詳細な静的空間特徴を捉えるため、ビデオ内のキーフレーム情報の処理に適しています。
    • ファストストリーム高フレームレートでビデオを処理するが、1フレームあたりの特徴量は少なく、動き情報の捕捉に重点を置いており、ビデオの動的な変化の処理に適している。
  • 2段階のトレーニングプロセス
    • フェーズ1(画像理解)画像データを用いた教師ありファインチューニング(SFT)は、モデルに一般的な知識と推論能力を与え、画像タスクにおいてモデルが優れた基本性能を発揮することを保証する。
    • フェーズ2(ビデオと画像の合同トレーニング)第1段階を基盤として、画像データと動画データを用いた共同学習を実施し、画像タスクに対する高い理解能力を維持しながら、動画理解タスクにおけるモデルのパフォーマンスをさらに向上させる。
  • 高品質データミキシング
    • 画像データこれには、LLaVA Complex Reasoning、ShareGPT-4v、Coco Captionなどの、一般的なデータセット、テキストが豊富なデータセット、知識ベースのデータセットが含まれます。
    • ビデオデータ本モデルは、LLaVA-Hound、ShareGPT4Video、ActivityNet-QAなど、大規模なビデオデータや長尺ビデオの理解タスクを網羅しており、様々なビデオタスクにおいて優れた性能を発揮します。
  • モデルアーキテクチャビジュアルエンコーダーとしてOryx-ViT、言語モデル(LLM)としてQwen2.5シリーズを使用することで、ビデオ入力と画像入力に対応した異なるプロジェクターが設計され、様々なモダリティの入力特性に適応するようになっている。

SlowFast-LLaVA-1.5のプロジェクトアドレス

  • GitHubリポジトリ:https://github.com/apple/ml-slowfast-llava
  • arXiv技術論文:https://arxiv.org/html/2503.18943v1

SlowFast-LLaVA-1.5の応用シナリオ

  • 長尺動画コンテンツの理解と要約長尺動画の要約を自動生成し、ユーザーが主要な内容を素早く把握できるようにすることで、時間の節約に貢献します。
  • ビデオQ&Aシステムユーザーが自然言語で質問すると、モデルは長尺動画の内容に基づいて正確な回答を生成し、インタラクティブな体験を向上させます。
  • 動画編集と制作長尺動画から重要な部分を自動的に編集して短尺動画を生成することで、コンテンツ制作の効率を向上させます。
  • ビデオ監視と分析監視映像における群衆の集まりなどの異常な行動をリアルタイムで識別できるため、監視の精度を向上させることができる。
  • マルチメディアコンテンツのおすすめユーザーの視聴履歴に基づいて、ユーザーエンゲージメントを高めるための関連性の高い長尺動画コンテンツを推奨します。