project
Light-A-Video - 上海AIラボが上海交通大学をはじめとする複数の大学と共同で開発した、動画の照明調整手法。
Light-A-Videoは、上海交通大学、中国科学技術大学、香港中文大学、香港科技大学、スタンフォード大学、上海AIラボが共同開発した、トレーニング不要のビデオ照明再調整手法です。これは、プログレッシブな...
Light-A-Videoとは何ですか?
Light-A-Videoは、上海交通大学、中国科学技術大学、香港中文大学、香港科技大学、スタンフォード大学、上海AIラボが共同開発した、学習不要のビデオ再照明手法です。プログレッシブライトフュージョン技術に基づき、高品質で時間的に一貫性のあるビデオ照明制御を実現します。Light-A-Videoは、Consistent Light Attention(CLA)とProgressive Light Fusion(PLF)という2つの主要モジュールを実装しています。CLAは、フレーム間の相互作用を強化することで背景光源の生成を安定させ、PLFは、ビデオ拡散モデルの動き事前情報に基づいて再照明効果をビデオに徐々に統合し、スムーズな照明遷移を保証します。Light-A-Videoは、ビデオ全体の再照明と、前景シーケンスの再照明による背景生成をサポートしています。
Light-A-Videoの主な機能
- 時間的一貫性これは、フレーム間の照明の一貫性を高めることで、ビデオのちらつきや照明の不連続性といった問題を回避することを目的としています。
- 高品質な再照明事前学習済みの画像再照明モデルは、画質を維持しながらビデオの各フレームの照明を調整するために使用されます。
- 前景と背景の分離処理動画の前景の照明を調整し、照明条件に合った背景を自動的に生成します。
- ゼロショット生成追加のトレーニングや最適化は不要です。テキストによる指示に基づいて、照明条件に合った動画を直接生成します。
- 高い互換性AnimateDiff、CogVideoXなど、様々な人気動画生成モデルと互換性があり、幅広い用途に対応できます。
Light-A-Videoの技術原理
- Consistent Light Attention (CLA):
- CLAモジュールは、フレーム間の相互作用を強化することで、照明光源の生成を安定化させます。画像再照明モデルの自己注意層にフレーム間情報を導入し、時間平均化の特徴に基づいて照明の高周波ジッターを抑制することで、安定した背景照明を生成します。
- CLAは、デュアルストリーム・アテンション融合戦略を採用しています。一方のストリームは元のフレーム情報を処理し、詳細を保持します。もう一方のストリームは、ジッターを抑制するために時間平均に基づいて処理されます。最後に、2つのストリームの出力は加重平均によって融合されます。
- Progressive Light Fusion (PLF):
- PLFモジュールは、ビデオ拡散モデル(VDM)からの動きの事前情報を用いて、リライティング効果をビデオに徐々に統合します。線形融合に基づいて、リライティング画像の見た目と元のビデオの見た目を組み合わせることで、滑らかな照明遷移を実現します。
- PLFは、ビデオ拡散モデルのノイズ除去処理中に、照明目標を段階的に調整します。融合重みの動的な調整に基づいて、ビデオノイズ除去の方向を段階的に誘導し、時間的に一貫性のある再照明効果を実現します。
- 全体的なプロセス入力ビデオはまず潜在空間にノイズ信号として符号化され、その後VDMノイズ除去処理によって徐々に復元されます。各ノイズ除去ステップにおいて、CLAモジュールとPLFモジュールが連携して、リライティング情報をビデオに段階的に注入します。
Light-A-Videoのプロジェクトアドレス
- プロジェクト公式サイト:https://bujiazi.github.io/light-a-video.github.io/
- GitHubリポジトリ:https://github.com/bcmi/Light-A-Video/
- arXiv技術論文:https://arxiv.org/pdf/2502.08590
Light-A-Videoの応用事例
- 映画やテレビ番組のポストプロダクション昼夜を問わず、照明条件を素早く調整できるため、コストと時間を節約できます。
- ゲーム開発シーンの照明を動的に変更することで、没入感を高めます。
- 動画制作クリエイティブなニーズに合わせて、動画のスタイルを素早く変更できます。
- VR/ARリアルタイムの照明調整により、仮想世界と現実世界の融合が強化される。
- ビデオ会議リモートコラボレーション体験を向上させるため、ビデオ照明を最適化します。