project
Lucy 2 - Decart AIによるリアルタイム動画生成モデル
Decart AIが開発したLucy 2.0は、リアルタイムの世界変換モデルであり、高精細なビデオ編集をオフラインレンダリングからインタラクティブなリアルタイム体験へと飛躍させることを可能にする。
ルーシー2とは何ですか?
Decart AIのリアルタイム世界変換モデルであるLucy 2.0は、高忠実度ビデオ編集をオフラインレンダリングからインタラクティブなリアルタイム体験へと飛躍させます。純粋な拡散モデルであるため、3Dジオメトリや深度マップに依存せず、ビデオの進化を観察することで物理的挙動を完全に自律的に学習し、1080p解像度でほぼゼロレイテンシー(30fps)での連続的な画像生成を可能にします。スマート履歴拡張技術に基づいて、このモデルは長期間にわたる品質ドリフトを自己修正し、何時間にもわたる途切れのない一貫性のある生成をサポートします。AWS Trainium 3向けに高度に最適化されたこのモデルは、リアルタイムのキャラクター置換、仮想試着、その他の視覚効果に使用でき、ロボットトレーニングのためのリアルタイムデータ拡張と物理的に一貫性のあるシミュレーション環境を提供します。
Lucy 2の主な機能
- リアルタイムのビジュアル変換このモデルは、ほぼゼロの遅延で30fps、1080p解像度の映像を連続的に生成し、事前レンダリングを必要とせずにライブ配信中のリアルタイム編集をサポートします。
- 多次元編集テキストプロンプトと参照画像を通して、キャラクターの置き換え、服装の変更、商品の配置、モーションコントロール、そして環境全体の変形を可能にします。
- 持続的な運用能力スマート履歴拡張技術の助けを借りれば、アイデンティティの崩壊、幾何学的歪み、テクスチャの劣化を起こすことなく、何時間も連続して動作させることができます。
- ロボットデータ拡張リアルタイムシミュレーションエンジンとして、物理的な一貫性を維持しながら、素材、照明、環境をリアルタイムで変化させ、単一のリアルなデモンストレーションを数千ものトレーニングバリエーションへと拡張します。
ルーシー2の技術的原理
- 純粋な拡散アーキテクチャ深度マップ、3Dメッシュ、明示的な物理エンジンには依存せず、すべての視覚的なダイナミクスはビデオを観察することによって自律的に進化します。
- 新たな物理的理解このモデルは、位相規則を手動で定義する必要なく、データから世界構造(指の形状、布のしわ、物体の分離など)を暗黙的に学習します。
- Smart History Augmentationトレーニング段階では、モデルは自身の不完全な出力にさらされ、ペナルティを受けることで、前のフレームを盲目的に追従するのではなく、ドリフトを認識して積極的に修正することを学習できるようになります。
- ハードウェアの協調最適化AWS Trainium3向けに高度にカスタマイズされており、メガカーネルを使用して起動時のオーバーヘッドを削減し、オンチップSRAMを使用して高帯域幅のメモリ遅延を回避し、カスタムWebRTCパイプラインを使用してエンドツーエンドのリアルタイム伝送を実現しています。
ルーシー2プロジェクトの住所
- プロジェクト公式サイト:https://decart.ai/publications/lucy-2-introducing-sota-video-generation-in-realtime
- オンラインでデモを体験してください:https://lucy.decart.ai/
Lucy 2の応用シナリオ
- ライブストリーミングでのインタラクションホストは、ライブ配信中に瞬時にキャラクターを切り替えたり、仮想的に服を試着したり、商品を動的に挿入したりすることができ、ポストプロダクションなしでリアルタイムに多様な視覚効果を提示できます。
- オンサイトコンテンツ作成クリエイターは、テキストプロンプトを通して撮影現場でシーンのスタイルや雰囲気をリアルタイムで調整できるため、ポストプロダクションのプロセスを前倒しし、まさに画面に映し出される映像を即座にプレビューすることが可能になります。
- ロボットトレーニングの強化研究開発チームは、対象物の材質、照明、背景環境をリアルタイムで変更できるため、1つの実際の操作ビデオを、物理的に一貫性があり多様な数千のトレーニングサンプルに拡張することができ、データ不足の問題を解決します。
- 仮想制作シミュレーション制作チームは、このモデルが長期間安定して動作する能力を活用することで、インタラクティブな動的背景や環境シミュレーションをリアルタイムで生成し、従来のオフラインレンダリング制作プロセスを直接置き換えることができます。