project
JoyAI-Echo - JD.comのオープンソース長尺音声/動画生成フレームワーク
JoyAI-Echoは、JD.comが開発したオープンソースの長尺動画生成フレームワークで、特に1分単位のマルチショットストーリー生成向けに設計されています。このフレームワークは、クロスモーダルメモリライブラリ、メモリ駆動型ポストトレーニング、Director Agentによる会話型編集、軽量な…
JoyAI-Echoとは何ですか?
JoyAI-Echoは、JD.comが開発したオープンソースの長尺動画生成フレームワークで、1分単位で複数のショットからなるストーリーを生成するために特別に設計されています。クロスモーダルメモリライブラリ、メモリ駆動型ポストトレーニング、Director Agentによる対話型編集、軽量リアルタイム超解像という4つの主要な技術革新により、キャラクターの顔の変化、声の急激な変化、生成速度の遅さなど、長尺動画生成における主要な課題を解決します。これにより、最大5分間の長さで、一貫性が高く、インタラクティブで、高解像度の長尺動画を初めて生成することが可能になり、JD.comは長尺動画生成の世界トップレベルに躍り出ました。
JoyAI-Echoの主な機能
-
分単位のマルチカメラによるストーリー生成単一のキューワードJSONから、最大5分間の、複数のカメラを使用した一貫性のある長尺ビデオシーケンスを生成することをサポートします。
-
クロスモーダルな音声と映像の同時生成単一のパイプラインが映像と音声を同時に出力することで、映像と音声の同期が保証されます。
-
ペアになったクロスモーダルメモリバンク:マルチカメラ生成中にキャラクターの外見の特徴や話者の声質を継続的に保存および呼び出し、ストーリーレベルの一貫性を維持する。
-
DMD蒸留の短ステップ推論分配整合蒸留技術を用いることで、生成速度は約7.5倍に増加する。
-
ディレクター兼エージェント(会話編集)ユーザーは自然言語を使って監督のアシスタントとやり取りでき、脚本、登場人物、シーン、ショットが自動的に分解されるため、ビデオ全体を再再生することなく部分的な修正が可能になります。
-
軽量リアルタイム超解像736×1280から1152×1920または1472×2560への単一ステップの超解像度化をサポートし、ストリーミング遅延の制約下でも高精細な出力を維持します。
JoyAI-Echoの技術原理
- クロスモーダルな音声およびビデオメモリJoyAI-Echoの核となる技術革新は、内蔵されたペア型クロスモーダルメモリバンクにあります。このメモリバンクは、スロットペアリング機構によって視覚情報と音声情報を結合・保存します。マルチショット生成中、メモリバンクはキャラクターの顔の特徴、全体的な外見、声質、そして音声と映像の対応関係を継続的に保存・取得し、各ショットが前のショットの特徴に基づいて生成されることを保証します。これにより、5分間の動画全体を通してストーリーレベルの一貫性が維持され、キャラクターの顔の変化や声の急激な変化といった問題が完全に解消されます。
- メモリ駆動型ポストトレーニングとDMD蒸留の高速化研究チームは、教師ありファインチューニング(SFT)、クロスモーダルRLHF、および分布マッチング蒸留(DMD)技術を組み合わせた、メモリ駆動型のポストトレーニングワークフローを導入しました。中でもDMDは、元の多段階拡散推論を数段階の推論に圧縮し、生成品質を維持しながら推論速度を約7.5倍向上させ、1分間の動画のストリーミング生成を理論上のものから実用的なものへと変えました。
- ディレクターエージェントインタラクションアーキテクチャこのフレームワークは、ユーザーの自然言語による意図を構造化されたスクリプト、ショット、キャラクター描写、シーン描写に自動的に展開するインテリジェントなディレクターエージェントを導入し、計画、生成、レビュー、部分的な修正というクローズドループのワークフローをサポートします。ユーザーは対話を通じて修正を指定でき、エージェントはビデオ全体を再実行することなく問題のあるショットのみを再生成するため、静的な生成が動的なコラボレーションへと変化します。
- 軽量リアルタイムオーディオおよびビデオ超解像度プロフェッショナルなコンテンツ制作における高解像度要件を満たすため、JoyAI-Echoはワンステップのオーディオおよびビデオ超解像モジュールを搭載しています。このモジュールは、ストリーミング遅延の制約下で、736×1280の基本出力をリアルタイムで1152×1920または1472×2560に鮮明化することができ、高解像度出力がストリーミング生成のリアルタイム性能を損なわないようにします。
JoyAI-Echoの使い方
-
リポジトリのクローン作成:
git clone https://github.com/jd-opensource/JoyAI-Echo.git -
環境づくりcondaまたはuvを使用してPython 3.11 + PyTorch 2.8 + CUDA 12.8の依存関係をインストールし、以下のことを確認してください。
ffmpeg利用可能。 -
モデルの重量をダウンロードHugging Faceから約46GBをダウンロードしてください
echo-longvideo-release.safetensorsそして約24GBgemma-3-12bテキストエンコーダーは、checkpoints/目次。 -
物語のきっかけとなるアイデアを書く各ショットを、登場人物と被写体、アクションとセリフ、スタイル、カメラワーク、背景、効果音、BGMの順に記述したJSONファイルを作成してください。
-
推論を実行中:埋め込む
python inference.pyモデルが一度読み込まれると、すべてのプロンプトファイルが処理され、[適切なサーバー/システム]に出力されます。inference_result/outputs/目次。
JoyAI-Echoの主な利点
-
超長時間持続5分間の動画の中で、登場人物のアイデンティティ、外見、声質は非常に一貫しており、同一人物が演技中に別人になってしまうという問題を完全に解決している。
-
急速な生成メモリ駆動型の事後学習とDMD技術を組み合わせることで、推論速度が約7.5倍向上し、半日かかっていた待ち時間が瞬時に出力されるようになります。
-
対話型インタラクティブ制作Director Agentは、静的な生成を動的なコラボレーションへと変革し、自然言語による計画、レビュー、およびローカルでの修正をサポートすることで、制作の障壁を大幅に低減します。
-
高精細リアルタイム出力軽量な超解像モジュールは、ストリーミング遅延を抑えながら高解像度ビデオを安定して出力し、プロフェッショナルなコンテンツ制作のニーズを満たします。
-
完全オープンソースコードと重み付けはすべてオープンソースであり、LTX-2.3とGemmaをベースに構築されており、学術研究と二次開発をサポートしています。
JoyAI-Echoプロジェクトのアドレス
- プロジェクト公式サイト:https://echo-team-joy-future-academy-jd.github.io/Echo-LongVideo-Page/
- GitHubリポジトリ:https://github.com/jd-opensource/JoyAI-Echo
JoyAI-Echoと類似の競合製品との比較
| 比較対象寸法 | JoyAI-Echo | HappyOyster |
|---|---|---|
| 長尺動画生成機能 | 最も長くサポートする 5分マルチカメラによる一貫性のあるストーリー生成 | 長時間の動画生成に対応しているが、具体的な再生時間は明示されていない。 |
| 役割/アイデンティティの一貫性 | 59.4% ユーザー設定。クロスモーダルメモリにより、複数のショットにおけるキャラクターの外見と声の一貫性が確保されます。 | ユーザーの27.7%はこの方法を好んでいます。同様のメモリ機構は明示的に開示されていません。 |
| 視覚美学 | 63.6% ユーザー設定 | ユーザーの好みの27.6% |
| 音質 | 81.7% ユーザー設定、音声と映像の同時生成、安定した音質。 | ユーザー嗜好の11.8% |
| 指示語が続きます | 80.6% ユーザー設定。Director Agentはスクリプトとショットを自動的に分割します。 | ユーザーの好みの5.9% |
| 生成速度 | DMD蒸留は加速される。7.5倍推論速度の向上、ストリーミング生成をサポート | 標準的な多段階拡散推論では、加速メカニズムは明示的に明らかにされない。 |
| 会話型編集 | Director Agentは自然言語による対話と局所的なショット修正をサポートしており、映画全体を再生する必要性をなくします。 | 対話型のローカル編集は明示的にはサポートされていません。 |
| リアルタイム超解像 | 軽量なシングルステップ超解像度、最大 1472×2560 | リアルタイム超解像は明示的にはサポートされていません。 |
| オープンソースの状況 | コードと重み付けデータは完全にオープンソースです(学術研究/非営利目的での使用に限ります)。 | オープンソースではない |
| 基盤となるアーキテクチャ | LTX-2.3 + Gemma-3-12Bに基づき、ペアになったクロスモーダルメモリバンクを条件付きで生成する。 | 独自開発モデルに基づいているため、具体的な技術的詳細はほとんど公開されていない。 |
JoyAI-Echoの応用シナリオ
-
バーチャルストーリー制作とアニメーション制作この技術は、数分間にわたる一貫性のあるアニメーションストーリーを生成し、複数のショットにわたってキャラクターの外見、声、性格の一貫性を高度に維持することで、従来のアニメーション制作コストを大幅に削減します。
-
デジタルヒューマンコンテンツ制作とライブストリーミングこれにより、バーチャルアンカーやデジタルヒューマンのカスタマーサービス担当者向けの長時間のビデオコンテンツを迅速に生成することが可能になり、長時間の出力中にデジタルヒューマンの顔や声がずれることがなくなり、リアリティとプロ意識が向上します。
-
ブランドマーケティング動画は急速に進化するDirector Agentの対話型編集機能を使えば、マーケティングチームはまるでチャットをするように簡単に広告スクリプトや映像を修正でき、ブランドビデオの複数のバージョンを迅速に作成して、クリエイティブサイクルを短縮できます。
-
映画・テレビのプリプロダクションデモンストレーションおよびストーリーボード制作監督やプロデューサーは、自然言語を用いて長編映画の絵コンテやプレビュー動画を作成し、正式な撮影前にカメラワーク、キャラクターの動き、物語のリズムなどを確認することで、試行錯誤にかかるコストを削減できる。