AB
AiBoss
project

LCVD - 四川大学が開発した、照明制御によるポートレートアニメーション生成フレームワーク

LCVD(Lighting Controllable Video Diffusion Model)は、四川大学が開発した、高忠実度で照明制御可能なポートレートアニメーション生成フレームワークです。LCVDは、ポートレートの本質的な特徴(アイデンティティや外見など)を分離することに基づいています。

LCVDとは何ですか?

LCVD(Lighting Controllable Video Diffusion Model)は、四川大学が開発した、高忠実度で照明制御可能なポートレートアニメーション生成フレームワークです。LCVDは、ポートレートの固有特徴(アイデンティティや外見など)と外在特徴(ポーズや照明など)を分離し、参照アダプタとシャドウアダプタを用いてこれらの特徴を異なるサブスペースにマッピングします。アニメーション生成時には、LCVDは特徴サブスペースを結合し、マルチ条件分類器誘導メカニズムを用いて照明効果をきめ細かく制御することで、ポートレートのアイデンティティと外見を維持します。このモデルは、安定ビデオ拡散モデル(SVD)に基づいており、駆動ビデオのポーズと整合性が取れ、目標とする照明条件を満たす高品質なポートレートアニメーションを生成します。LCVDは、照明のリアリズム、画質、ビデオの一貫性において既存の手法を大幅に上回り、仮想現実、ビデオ会議、映画・テレビ制作などの分野に強力な技術的サポートを提供します。

LCVDの主な機能

  • アニメーション静止画のポートレートを、動画内の頭部の動きや表情に合わせて連動させ、動的な動画に変換します。
  • 光制御アニメーション生成中、肖像画はユーザーが指定した照明条件、または参照画像に基づいて再照明されます。
  • 身元と外見は維持されるアニメーションや照明の変更を行う際は、肖像画のアイデンティティと外観を維持し、個人情報が失われないようにしてください。
  • 高品質なビデオ生成生成された動画は、照明のリアリティ、画質、動画の一貫性において非常に優れた性能を発揮するため、バーチャルリアリティ、ビデオ会議、映画やテレビ番組制作などの用途に適しています。

LCVDの技術原理

  • 特徴分離リファレンスアダプタは、参照ポートレートの固有特徴(アイデンティティと外観)を特徴空間にマッピングします。シェーディングアダプタは、外在特徴(照明とポーズ)を特徴空間にマッピングします。固有特徴と外在特徴を分離することで、モデルはアニメーション中に照明とポーズを独立して制御できます。
  • 光制御拡散モデル安定した映像拡散モデルに基づき、分類器を用いない誘導手法を用いて照明効果を調整する。誘導強度(例えば重みω)を変更することで、照明キューの影響を強めたり弱めたりすることができ、きめ細やかな照明制御を実現する。
  • モーションアライメントと長尺動画の生成モーションアライメントモジュールに基づき、生成されたポートレートは運転動画のポーズと確実に一致するように調整されます。拡散モデルサンプリング法を用いて任意の長さの動画を生成し、オーバーラップ戦略によって動画セグメント間のスムーズな遷移を実現します。
  • トレーニングと最適化トレーニング段階では、自己教師あり学習によってアダプターと拡散モデルが最適化され、生成された動画全体で照明、姿勢、および人物の同一性が維持されます。LPIPS、FIDなどの損失関数を用いて、生成された動画の品質を評価および最適化します。

LCVDプロジェクトの住所

LCVDの応用

  • 仮想現実(VR)と拡張現実(AR)仮想世界や現実世界のシーンに自然に溶け込む、リアルな仮想キャラクターを作成します。
  • ビデオ会議リアルタイムで高品質なポートレートアニメーションを生成することで、帯域幅の要件を削減し、ユーザーエクスペリエンスを向上させます。
  • 映画およびテレビ制作さまざまな照明条件に適したポートレートアニメーションを素早く生成し、特殊効果やバーチャルシーンで使用できます。
  • ゲーム開発ゲームのリアリティと没入感を高めるために、リアルな仮想キャラクターアニメーションを生成する。
  • ソーシャルメディアとコンテンツ制作ユーザーがパーソナライズされた動的なアバターや短い動画を作成することをサポートし、コンテンツ作成の形式を豊かにします。