project
JoyAI-Video-Edit - JD.comのオープンソースリアルタイムストリーミングビデオ編集モデル
JoyAI-Video-Editは、JD.comが開発しオープンソース化したリアルタイムストリーミングビデオ編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャに基づいており、720P解像度で30FPSの推論速度を実現し、あらゆる長さのストリーミング編集を安定してサポートします。
JoyAI-Video-Editとは何ですか?
JoyAI-Video-Editは、JD.comが開発しオープンソース化したリアルタイムストリーミングビデオ編集モデルです。16Bパラメータの自己回帰拡散アーキテクチャに基づき、720P解像度で30FPSの推論速度を実現し、あらゆる長さのストリーミング編集を安定してサポートします。ユーザーは、動画の再生中に自然言語コマンドを使用して、人物、シーン、スタイル、オブジェクトをリアルタイムで変更でき、動画全体の生成を待つ必要はありません。このモデルは、OpenVE-Benchベンチマークにおいて、すべてのストリーミング編集手法を凌駕し、あらゆる指標でトップの成績を収めています。また、具現化された知能のための大規模データ合成パスも提供します。
JoyAI-Video-Editの主な機能
-
リアルタイムストリーミング編集動画フレームは到着後すぐに編集できるため、全体のシーケンスを事前に把握しておく必要はありません。
-
オープン命令制御グローバルなスタイル移行、ローカルオブジェクトの追加、削除、変更、背景の置換、アクションの調整、および参照画像による編集をサポートしています。
-
任意の期間の処理秒や分といった時間制限を打破することで、動画再生中に安定した編集が可能になります。
-
720P高スループット展開エンドツーエンドのパイプラインは、720×1280の解像度で30.19 FPSを実現します。
-
多次元編集機能これには、キャラクターの衣装変更、シーンの変換、スタイルの変換、オブジェクトの置き換え、字幕編集などの作業が含まれます。
JoyAI-Video-Editの技術的原理
-
MLLM条件エンコーダ: 多モーダルな大規模言語モデルを使用して、自然言語による指示を編集条件にエンコードし、オープンな意味制御を実現します。
-
因果関係ビデオVAE因果的な時間構造を持つ変分オートエンコーダーを使用してビデオフレームを圧縮および再構築し、ストリーミングシナリオにおける時間的な一貫性を確保します。
-
16BパラメータMMDiTバックボーン16Bマルチモーダル拡散トランスフォーマーをコアとして使用し、テキスト特徴と視覚特徴を融合することで自己回帰拡散生成を実行する。
-
自己回帰分布マッチング蒸留自己回帰分布に沿った蒸留戦略を採用することで、推論が高速化され、訓練データと推論データ間の分布のずれが大幅に低減される。
-
長期最適化と限定されたキーバリュー推論:累積的なタイミングドリフトを抑制し、高いスループットを維持するために、長期安定性の最適化と制限付きKVキャッシングメカニズムを導入します。
WeChatでフォローして「オープンソース「、参加するAIオープンソースプロジェクトに関するディスカッショングループ
JoyAI-Video-Editの使い方
-
環境準備Conda環境の作成
python=3.10そしてインストールするrequirements.txt頼る。 -
ダウンロード重量Hugging Faceからモデルファイルを取得し、指定されたディレクトリ構造に従ってチェックポイントを配置します。
-
サービスを開始する:入力
deployディレクトリ実行bash run_server.shローカルサーバーを起動します。 -
アクセスインターフェースブラウザで開く
http://localhost:8080対話型編集インターフェースに入ります。 -
リアルタイム編集動画をアップロードしたり、カメラのストリームに接続したり、自然言語コマンドを入力して再生しながら編集したりできます。
JoyAI-Video-Editの主な利点
-
リアルタイムストリーミング編集動画フレームは、シーケンス全体が完了するのを待つことなく、到着次第すぐに処理されるため、真の「再生しながら編集」というインタラクティブな体験が実現します。
-
スピードと品質の両方において優れている720P解像度では、エンドツーエンドの推論が30.19 FPSに達し、OpenVE-Benchベンチマークにおけるすべてのストリーミングおよびオフライン編集方法を上回ります。
-
あらゆる期間にわたって安定した出力従来のモデルが秒単位または分単位のセグメントしかサポートしていなかったという制約を打ち破り、動画再生中にドリフトのない安定した編集を継続的に実行できます。
-
オープンセマンティック制御MLLM条件付きエンコーダーをベースとしており、グローバルスタイル、ローカルオブジェクト、背景置換、参照画像ガイダンスなど、自然言語による指示に基づいた多次元編集をサポートしています。
-
高効率推論アーキテクチャ16Bパラメータの自己回帰拡散トランスフォーマーは、分布マッチング蒸留と境界付きKVキャッシングと組み合わせることで、トレーニングと推論の不一致を大幅に低減し、時間的な累積誤差を抑制します。
JoyAI-Video-Editプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/jd-opensource/JoyAI-Video-Edit
- ハギングフェイスモデルライブラリ:https://huggingface.co/jdopensource/JoyAI-Video-Edit
- arXiv技術論文:https://arxiv.org/pdf/2608.03974
JoyAI-Video-Editと類似競合製品との比較
| 寸法 | JoyAI-Video-Edit | SANA-Streaming |
|---|---|---|
| モデルサイズ | 16Bパラメータ | 2Bパラメータ |
| 推論速度 | 37.21 FPS (DiT) | 約54 FPS (DiT) |
| 編集品質 | 3.60 (OpenVE-Bench) | 約2.6 |
| 編集タイプ | 自由度の高い多次元編集 | ストリーミング編集 |
| 解決サポート | 720Pの安定出力 | 主に低解像度 |
| タイミングの安定性 | 任意の期間に対する制限付きキーバリュー最適化 | 短いクリップ |
JoyAI-Video-Editの応用シナリオ
-
ショートビデオ制作クリエイターは、動画再生中にリアルタイムでキャラクターの衣装を変更したり、シーンのスタイルを調整したりできるため、コンテンツ制作の効率が向上します。
-
ライブストリーミングリアルタイムエフェクトホストは、配信中に背景を変更したり、仮想要素を追加したりすることで、インタラクティブなライブストリームの視覚的なインパクトを高めることができます。
-
家の装飾とインテリアデザインユーザーは部屋の動画を閲覧しながら、家具、壁材、照明効果などをリアルタイムで変更できるため、インテリアコーディネートの決定に役立ちます。
-
映画・テレビのポストプロダクションプレビュー編集段階では、監督は試行錯誤のコストを削減するために、さまざまな映像スタイルやシーンの差し替えを迅速に試す。
-
具現化されたインテリジェントデータ合成人間の手の操作動画をロボットアームの操作教材に変換することで、ロボットの訓練データを低コストで拡張することが可能になる。