project
StreamBridge - Appleと復旦大学が共同開発した、大規模なビデオ言語モデルフレームワーク。
StreamBridgeは、Appleと復旦大学が共同開発したエッジサイドビデオ大規模言語モデル(Video-LLM)フレームワークであり、AIがライブビデオストリームをリアルタイムで理解するのに役立ちます。このフレームワークは、メモリバッファとラウンドベースの減衰圧縮戦略に基づいています。
StreamBridgeとは何ですか?
Appleと復旦大学が共同開発したビデオLLMフレームワークであるStreamBridgeは、AIがライブビデオストリームをリアルタイムで理解するのに役立ちます。このフレームワークは、メモリバッファとラウンド減衰圧縮戦略に基づく長時間のコンテキストインタラクションをサポートし、軽量なアクティベーションモデルを導入することで、プロアクティブな応答機能を実現しています。研究チームは、ストリーミングビデオの理解能力を強化するために、約60万サンプルを含むStream-ITデータセットを公開しました。LLaVA-OV-7B、Qwen2-VL-7B、Oryx-1.5-7Bなどの主流のオフラインモデルに対するテストでは、StreamBridgeがモデルのマルチラウンドリアルタイム理解とプロアクティブな応答能力を大幅に向上させ、ストリーミングビデオ理解の分野で大きな可能性を示していることが示されました。
StreamBridgeの主な機能
- マルチターンリアルタイム理解最新のビデオクリップを処理する際に、過去の視覚的および対話的なコンテキストを保持しながら、長いコンテキストを伴う複数ターンのインタラクションをサポートします。
- アクティブレスポンスこのモデルは、人間のようにビデオストリームを積極的に監視し、明示的な指示なしにタイムリーなフィードバックを提供することができる。
- 柔軟な統合既存のビデオ言語モデルへのシームレスな統合をサポートし、基盤となるモデルに大規模な変更を加える必要がありません。
- データサポート本システムは、約60万のサンプルを含む大規模なストリーミングビデオ理解データセットであるStream-ITを提供し、モデルのトレーニングと最適化のための多様な指示フォーマットをサポートしています。
StreamBridgeの技術原理
- メモリバッファこのシステムは、ビデオフレームの埋め込み情報を保存および取得し、複数ターンの対話に対応します。新しいビデオフレームはそれぞれ個別にエンコードされ、バッファに追加されます。ユーザーからのクエリを受信すると、バッファの内容は単一の入力埋め込みシーケンスに平坦化され、応答生成のために言語モデルに入力されます。
- ラウンド減衰圧縮戦略各応答が生成される前に、入力埋め込みの長さが事前に定義された最大長を超える場合、モデルは最初の対話ターンから開始して、合計の長さが最大長を下回るまで、フレームごとにビジュアルタグをマージします。マージ操作は、最新のビジュアルコンテキストが保持されるように、平均プーリングに基づいて実装されます。
- 軽量アクティベーションモデルアクティベーションモデルは、メインのビデオ大規模言語モデルと並行して動作する、スタンドアロン型の軽量マルチモーダル大規模言語モデル(MLLM)です。アクティベーションモデルは、現在のフレーム(およびユーザーのクエリとオプションの最初の数フレーム)を入力として受け取り、メインモデルが応答を生成するかどうかを示すバイナリ信号を出力します。アクティベーションモデルは、バイナリ分類(応答の有無)にスコアヘッドを使用し、トレーニング中に学習可能なアクティベーションラベル<ACT>を導入して、アクティベーションのタイミングを監視します。
- Stream-ITデータセット約60万個のサンプルからなるこのデータセットは、大規模な動画キャプションコーパスから複数ターンにわたる質疑応答シーケンスを生成することで、リアルタイムのユーザーインタラクションをシミュレートするように設計されています。高密度動画キャプション生成、シーケンシャルステップ認識、動画ベースの質疑応答など、さまざまなタスク形式に対応しています。
StreamBridgeプロジェクトの住所
- arXiv技術論文:https://arxiv.org/pdf/2505.05467
StreamBridgeの応用シナリオ
- リアルタイムのビデオインタラクションビデオ会議やオンライン教育などの場面において、リアルタイムのインタラクティブな体験を向上させます。
- 自動運転支援自動運転における意思決定を支援するため、道路状況の映像をリアルタイムで処理する。
- インテリジェントモニタリング監視映像をリアルタイムで分析し、異常行動を迅速に検出する。
- ロボットビジョンこれは、ロボットがリアルタイムで周囲の環境を理解し、自然な相互作用を実現するのに役立つ。
- コンテンツ作成機能:動画の作成と編集を支援し、リアルタイムのコンテンツ分析を提供する。