project
JoyAI-VL-Interaction - JD.comのオープンソースリアルタイムビデオ視覚言語インタラクションモデル
JoyAI-VL-Interactionは、JD.comのJoy Future Academyが開発したオープンソースのリアルタイムビデオ視覚言語インタラクションモデルです。世界初のフルスタック・オープンソース・インタラクションモデルシステムです。
JoyAI-VL-Interactionとは何ですか?
JoyAI-VL-Interactionは、JD.comのJoy Future Academyが開発したオープンソースのリアルタイムビデオビジュアル言語インタラクションモデルです。世界初のフルスタックオープンソースインタラクションモデルシステムであり、大規模モデルでも質疑応答から同時視聴・発話へと移行し、ビデオストリームを継続的に監視し、発話タイミングを自律的に判断し、映像の変化にリアルタイムで対応できます。また、複雑なタスクをバックグラウンドエージェントに委任することも可能です。実際のユーザーによる58件のブラインドレビューでは、Doubao Video Call Assistantと比較して77.6%、Geminiと比較して87.9%の勝率を達成しました。
JoyAI-VL-Interactionの主な機能
-
能動的視覚反応カメラ映像/ライブストリーム/モニタリング映像を継続的に監視し、ユーザーが繰り返し質問する必要なく、いつ話すべきか、いつ沈黙すべきかを自律的に判断します。
-
リアルタイムストリーミングインタラクション進行中のビデオストリームに即座に反応し、シーンが変わった際に数秒以内にフィードバックを提供するため、後からビデオ全体を要約する必要はありません。
-
代理人委任コード生成、ツール呼び出し、複雑な推論などのタスクが発生した場合、そのタスクは自動的に大規模なバックエンドモデルまたはエージェントに引き渡され、フロントエンドは引き続き監視を行います。
-
マルチモーダル入出力音声入出力、ビジュアルインターフェース、長期記憶に対応しています。ASR/TTS/インターフェースは必要に応じて交換可能です。
-
長期記憶それは分単位の視覚記憶能力を備えており、数分前の場面の詳細を思い出し、質問に正確に答えることができる。
JoyAI-VL-Interactionの技術原理
- 視覚優先のインタラクション決定このモデルの中核は、1秒ごとに自動的に実行される意思決定(話す、沈黙する、または指示を委任する)です。このモデルは、JoyAI-VL-8B視覚言語指示モデルをベースに構築されており、音声をプラグイン可能な入出力として使用しています。モデルの唯一のタスクは、状況を観察し、適切なタイミングで行動を起こすことです。
- 予測ビデオコーディング本システムは、予測可能なフレームに対しては少量のトークンしか消費せず、シーンが実際に変化した場合でも完全なディテールを保持し、トークン予算をフレームごとに拡大するのではなく、時間とともにゆっくりと増加させることで、長期的なリアルタイムストリーミング処理をサポートする、AdaCodec予測ビデオコーデックを採用しています。
- 時間的整合性行動学習このモデルは、400万を超える時系列の対話セグメントを1秒ごとに注釈付けして学習させています。各データポイントには、いつ話すべきか、いつ沈黙すべきか、いつ指示を出すべきかが正確にラベル付けされており、さらに強化学習を用いて微調整することで、行動がデータから学習できるようになっています。
- プラグイン可能なシステムアーキテクチャコアモデルを中心に、ストリーミングASR/TTS、長期記憶モジュール、ビジュアルUI、バックエンドモデルブリッジを含む完全なデプロイメントシステムが構築されています。すべてのコンポーネントは個別に交換可能で、システム全体は標準のvLLMインフラストラクチャ上で動作し、vLLM-Omniからネイティブな初期サポートを受けられます。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
JoyAI-VL-Interactionの使い方
-
リポジトリのクローン作成GitHubのオープンソースリポジトリにアクセスする
jd-opensource/JoyAI-VL-Interaction完全なコードとデプロイメントシステムを入手してください。 -
モデルを取得するHugging Faceからダウンロード
jdopensource/JoyAI-VL-Interaction-Previewモデルの重み。 -
環境を整える標準的なvLLMインフラストラクチャの展開に基づいており、カメラ、RTSP監視ストリーム、ライブストリームなど、さまざまなビデオ入力をサポートします。
-
カスタムコンポーネント必要に応じて、ASR、TTS、音声サービス、エージェント、API、またはフロントエンドインターフェースを置き換えて、自社のビジネスシステムと統合してください。
-
運用経験一度起動したら、カメラやライブストリームを向けると、モデルはリアルタイムの観察およびインタラクション状態に入ります。
JoyAI-VL-Interactionの主な利点
-
フルスタックのオープンソース8Bモデル、トレーニング手順、400万の時系列データポイント、そして完全な展開可能なシステムはすべて、オープンで再現可能かつ拡張可能です。
-
現地でライブ配信応答遅延が1秒未満で、数時間にわたってライブストリームを継続的に監視できるため、ポーリングされて起動するのではなく、真に「その場にいる」状態を維持できます。
-
視覚的トリガーイニシアチブ画面の内容に基づいて話すタイミングを自律的に判断でき、監視や早期警告などのシナリオにおいて遅延のないアラームやリアルタイム翻訳を実現できる。
-
フロントエンドとバックエンドの分離フロントエンドモデルは途切れることのない視覚的観察を維持し、バックエンドは複雑なタスクを処理し、その結果は対話の流れを中断することなく自然にダイアログに反映される。
-
軽量で展開可能8Bパラメータはコンパクトで、標準的なインフラストラクチャ上で動作するため、リアルタイムAIアシスタントの導入障壁を低減します。
JoyAI-VL-Interactionプロジェクトのアドレス
- プロジェクト公式サイト:https://joyai-vl-video-future-academy-jd.github.io/JoyAI-VL-Interaction/
- GitHubリポジトリ:https://github.com/jd-opensource/JoyAI-VL-Interaction/
- ハギングフェイスモデルライブラリ:https://huggingface.co/datasets/jdopensource/JoyAI-VL-Interaction
- 技術論文:https://echovideo.jd.cn/JoyAI-VL-Interaction/JoyAI-VL-Interaction-Reportv1.pdf
JoyAI-VL-Interactionと類似の競合製品との比較
| 比較対象寸法 | JoyAI-VL-Interaction | 斗澳ビデオ通話モデル |
|---|---|---|
| モデルサイズ | 8Bパラメータ、軽量視覚言語インタラクションモデル | パラメータスケールが大きい、一般的なマルチモーダルモデル |
| コアパラダイム | ビジョンを最優先とした、能動的なインタラクションモデル。毎秒、「話す/沈黙する/委任する」ことを自律的に判断する。 | ポーリング式の質問応答モデルは、ユーザーが応答をトリガーした後にのみ、現在のフレームを処理します。 |
| リアルタイム処理 | ストリーミングビデオを継続的に監視し、画像の変化にリアルタイムで対応する。 | 主に、ユーザーが質問をした瞬間に撮影された静止画像のスナップショットを処理します。 |
| 時間感覚 | 時間認識機能を内蔵しているため、「20秒後にリマインダーを送信する」や「3秒ごとにブロードキャストを送信する」といった、時間順序に基づいたタスクを実行できます。 | タイミングタスクは一貫性がなく、テスト中に適切なタイミングでリマインダーを提供できなかった。 |
| メモリ機構 | 数分間持続する長期視覚記憶により、ユーザーは数分前の画像の詳細を思い出すことができる。 | 長期的な視覚記憶は、テストでミートボールの数を間違えるなど、誤りを起こしやすい。 |
| 視覚的なトリガー | 音声出力は、ユーザーの操作を必要とせず、視覚的なイベントによって自動的にトリガーされます。 | 応答は、ユーザーが積極的に質問した場合にのみ生成され、アラートを自動的に生成することはできません。 |
| 継続的な追跡 | キャプションの変更、繰り返し操作の回数、アプリのインターフェース切り替えを継続的に追跡します。 | フレーム間の状態を維持するのは難しく、カウントや変換処理は中断されやすい。 |
JoyAI-VL-Interactionの応用シナリオ
-
セキュリティ監視このシステムは、ストリームのリアルタイム監視と、転倒や侵入などの異常事態発生時の即時音声アラート機能を提供し、手動での画面監視の必要性を排除します。
-
高齢者介護/育児自宅の映像を継続的に監視し、危険な行動(例えば、コンロに近づいたり、一人で外出したりするなど)を避けるよう積極的に注意喚起する。
-
ライブ配信ガイド/Eコマースショッピングガイドライブ配信にリアルタイムで解説を加えたり、商品の詳細を自動的に紹介したり、ユーザーの服装に基づいて積極的にスタイリングの提案を行ったりする。
-
リアルタイム翻訳外国語の動画を視聴したり、対面でコミュニケーションをとったりする際に、字幕や会話内容を継続的に認識し、リアルタイムで音声翻訳を提供します。
-
操作手順静的なスクリーンショットを単に説明するのではなく、画面の変化に合わせて段階的な手順を示すことで、ユーザーがアプリやデバイスを操作できるようにガイドします。
-
AIメガネ/アクセシビリティ支援AIメガネの中核となる視覚認識機能として、視覚障害者向けに周囲の環境をリアルタイムで描写し、障害物を事前に警告する。