project
Audio-Visual Flamingo - NVIDIAをはじめとする企業が開発したオープンソースのオーディオビジュアル言語モデル。
Audio-Visual Flamingo(略称AV-Flamingo)は、NVIDIAとメリーランド大学が共同開発したオープンソースのオーディオビジュアル大規模言語モデルです。特に、長尺動画や複雑な実世界のオーディオビジュアルコンテンツの共同理解と推論を目的として設計されています。
オーディオビジュアル・フラミンゴとは何ですか?
Audio-Visual Flamingo(略称AV-Flamingo)は、NVIDIAとメリーランド大学が共同開発したオープンソースのオーディオビジュアル大規模言語モデルです。長時間の動画や複雑な実世界の音声・動画コンテンツの同時理解と推論を目的として設計されています。このモデルは、視覚情報と聴覚情報を同時に処理できるだけでなく、音声による対話出力もサポートしています。15種類以上のオーディオビジュアル、マルチモーダル、ビジュアルのベンチマークテストにおいて、パラメータ規模70億で、多くの大規模なオープンソースおよびクローズドソースモデルを上回る性能を発揮しています。
Audio-Visual Flamingoの主な機能
-
長尺動画のオーディオビジュアル統合理解最大15分間のビデオ入力に対応し、ビデオ、音声、環境音、音楽を同時に分析します。
-
異種感覚推論視覚情報と聴覚情報の両方を必要とする質問に答えてください(例:「動画内の特定の音に対応する画像はどれですか?」)。
-
時間ベースの推論TAVITフレームワークを用いて推論ステップをビデオのタイムスタンプに明示的に関連付けることで、時間的な整合性と解釈性が向上する。
-
音声対話出力音声および動画コンテンツに基づいたリアルタイム音声応答をサポートする、統合型ストリーミングTTS。
-
マルチスキル対応これには、関係推論、感情変化の追跡、因果推論、時空間知覚、幻覚検出、事象の計数など、13種類の能力が含まれる。
オーディオビジュアル・フラミンゴの技術的原理
-
建築SigLipビジュアルエンコーダとAF-Whisperオーディオエンコーダは、それぞれ画像/ビデオフレームの特徴とオーディオの特徴を抽出するために使用され、これら2つは2層MLPプロジェクターを介してLLM埋め込み空間にマッピングされます。
-
異種モーダルタイミングアライメント視覚トークンと音声トークンは時間ウィンドウに従って交互に配置され、モデルがマルチモーダルイベントの絶対的な時間シーケンスと相対的な順序を認識できるように、制約付き回転時間埋め込み(CRTE)が導入されています。
-
3段階の研修コース(1)事前トレーニング:AV-Skillsの短いコンテキストデータを使用する。(2)中間トレーニング:AV-Skillsの長いコンテキストデータを使用する。(3)事後トレーニング:連鎖思考データを使用して、短期的な知覚から長期的な複数イベント推論へと徐々に移行する。
-
データセットAudio-Visual-Skillsには、約700万件のトレーニング事例が含まれており、24万時間分のビデオを網羅しています。特に、時間的推論、構成的推論、および異種感覚モダリティ間の推論に重点が置かれています。
-
基本モデルQwen2.5-7Bをベースに、長いコンテキストを処理するために、ハイブリッドシーケンス並列処理とフルシャードデータ並列処理戦略を採用しています。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
Audio-Visual Flamingoの使い方
-
モデルを取得するオープンソースのモデル重み、推論コード、および設定ファイルをダウンロードするには、AV-FlamingoのGitHubリポジトリまたはHugging Faceのページにアクセスしてください。
-
環境設定Python環境を設定し、プロジェクトの依存関係をインストールします。その際、GPUに7Bパラメータモデルとそのマルチモーダルエンコーダをロードするのに十分なメモリがあることを確認してください。
-
入力準備完了分析対象の画像、動画、または音声ファイルを入力として受け取り、具体的なテキスト形式の質問または指示を記述します。
-
視覚的符号化視覚入力は、SigLipエンコーダによってマルチスケール空間特徴量を用いて抽出され、Dynamic S²モジュールによってコンパクトな視覚トークンシーケンスに圧縮される。
-
音声エンコーディング音声入力はリサンプリングされ、AF-Whisperエンコーダーによって30秒のスライディングウィンドウを使用して特徴が抽出されます。このエンコーダーは、任意の長さの音声ストリームをサポートします。
-
異種モダリティ間の連携このモデルは、投影レイヤーを介して音声およびビデオの特徴をLLM埋め込み空間に自動的にマッピングし、絶対的な時間順序を維持するために回転時間埋め込みを追加して、時間ウィンドウに従ってそれらを交互に配置します。
-
推論生成処理されたマルチモーダルトークンはテキストプロンプトと連結され、自己回帰推論のためにQwen2.5-7Bに入力され、テキスト応答が生成されます。
Audio-Visual Flamingoの主な利点
-
長尺動画の専門化1分以上、場合によっては15分までの長尺動画に最適化し、既存モデルにおける長尺動画でのパフォーマンス低下の問題を解決します。
-
真の共同推論データセットとトレーニング目標はどちらも、単一モダリティの機能を単に組み合わせるのではなく、クロスモダリティでの利用を想定して設計されている。
-
時間的解釈可能性TAVITでは、長い動画に関する質問に答える際に、モデルが「22秒から45秒まで」といった特定の時間間隔を推論の根拠として明示的に示すことができる。
-
完全オープンソースGPT-4oやGeminiといったクローズドソースのソリューションと比較して、AV-Flamingoはモデル、データ、コードのいずれにおいても完全にオープンである。
オーディオビジュアル・フラミンゴのプロジェクトアドレス
- プロジェクト公式サイト:https://avflamingo.pages.dev/
- GitHubリポジトリ:https://github.com/NVIDIA/audio-flamingo
- ハギングフェイスモデルライブラリ:https://huggingface.co/nvidia/nemotron-labs-audio-visual-flamingo-hf
- arXiv技術論文:https://arxiv.org/pdf/2607.16107
オーディオビジュアル・フラミンゴの競合製品比較
| 比較対象寸法 | AV-Flamingo | Qwen3.5-Omni |
|---|---|---|
| 研究開発 | NVIDIA + メリーランド大学 | アリババ |
| オープンソースレベル | 完全にオープンソースです(重み、コード、データ処理方法はすべて公開されています)。 | 公開されているのは重みのみであり、学習データと学習方法は公開されていません。 |
| パラメータスケール | 7B | 非公開(憶測の可能性が高い) |
| コアポジショニング | 長尺の音声・映像の共同理解と明示的な時間推論 | マルチモーダルなリアルタイム対話と生成 |
| 長尺動画の最適化 | 具体的には、最長15分間の3段階トレーニングコースをサポートします。 | 長尺の動画にも対応していますが、長尺動画専用のコースはありません。 |
| 時間的推論 | TAVITフレームワークは、推論ステップをタイムスタンプに明示的に関連付けます。 | 明示的なタイムスタンプの接地メカニズムはありません |
| トレーニングデータ | AVスキル(約700万件の事例、24万時間、13のスキルカテゴリ) | 非公開 |
| 音声出力 | テキストトークンのリアルタイムデコードに基づくストリーミングTTS。 | 音声出力はサポートされているが、具体的な仕組みは公開されていない。 |
| 長時間の動画ベンチマーク | MMOUの長尺動画推論において、より大規模なモデルよりも優れた性能を発揮します。 | 長時間の動画は、再生時間が長くなるにつれてパフォーマンスが低下します。 |
Audio-Visual Flamingoの応用シナリオ
-
映画およびテレビ番組のコンテンツ分析長編映画やテレビシリーズ向けに、重要なプロットポイントや効果音を特定したタイムスタンプ付きの詳細な解説を自動生成します。
-
教育とオンラインコース長時間の講義動画の場合、複数のモダリティを組み合わせた質疑応答を実施することで、学生は「先生はどの時点で特定の公式について言及しましたか?」といった質問をすることができます。
-
スポーツとイベントのレビューこの分析では、映像と現地解説を組み合わせ、戦術的な変更、ゴールシーン、解説者の意見などを検証する。
-
ポッドキャストとインタビュー処理純粋な音声ポッドキャストまたはオーディオビジュアルポッドキャストの構造化された要約を生成し、正確なタイムスタンプに基づく検索をサポートします。
-
セキュリティおよび監視レビュー長期監視映像では、音(例えばガラスが割れる音)と映像を組み合わせることで、異常な出来事を特定することができる。