AB
AiBoss
project

AnyCharV - 香港中文大学、清華大学、その他の機関が共同で立ち上げた、役割制御型の動画生成フレームワーク。

AnyCharVは、香港中文大学、清華大学深圳国際大学院、香港大学が共同開発した文字制御型動画生成フレームワークです。任意の参照文字画像とターゲットとなる動画を組み合わせることで、高品質な文字制御型動画を生成できます。

AnyCharVとは何ですか?

AnyCharVは、香港中文大学、清華大学深圳国際大学院、香港大学が共同開発した、文字制御型動画生成フレームワークです。任意の参照文字画像とターゲット駆動型動画を組み合わせることで、高品質な文字動画を生成します。AnyCharVは、きめ細かなガイダンスから粗いガイダンスへと段階的に進む2段階の学習戦略を採用しています。第1段階では、きめ細かなセグメンテーションマスクと姿勢情報を用いて自己教師あり合成を行い、第2段階では、自己強化学習と粗いマスクを用いて文字の詳細の保持を最適化します。AnyCharVは実験において優れた性能を発揮し、文字の外観の詳細を自然に保持し、複雑な人間と物体の相互作用や背景のブレンドをサポートします。AnyCharVは、テキストから画像への変換(T2I)モデルやテキストから動画への変換(T2V)モデルで生成されたコンテンツと組み合わせることができ、高い汎化能力を発揮します。

AnyCharVの主な機能

  • 任意のキャラクターとターゲットシーンを組み合わせる任意の人物画像とターゲットを絞った動画を組み合わせることで、自然で高品質な動画を生成できます。
  • 高精細なキャラクターディテールが保持されています自己強化訓練と大まかなマスキング指導に基づき、キャラクターの外観と細部が保持され、歪みが回避される。
  • 複雑なシーンと人間と物体の相互作用複雑な背景におけるキャラクターの自然な相互作用(移動やオブジェクト操作など)をサポートします。
  • 柔軟な入力サポートテキストから画像への変換(T2I)モデルとテキストから動画への変換(T2V)モデルを組み合わせることで生成されるコンテンツは、高い汎化能力を持つ。

AnyCharVの技術原則

  • フェーズ1自己教師あり合成と高精度ガイダンス:対象キャラクターのセグメンテーションマスクと姿勢情報を条件信号として使用し、参照キャラクターを対象シーンに正確に合成します。参照画像からのCLIP特徴とReferenceNetから抽出されたキャラクター外観特徴を導入することで、キャラクターのアイデンティティと外観を維持します。形状の違いによるディテールの損失を軽減するため、セグメンテーションマスクを大幅に強化します。
  • フェーズ2自己強化学習と粗粒度ガイダンス:生成された動画ペアに対して自己強化学習を実行します。文字形状の制約を軽減するため、細かいセグメンテーションマスクではなく、粗いバウンディングボックスマスクを使用します。このアプローチにより、モデルは参照文字の詳細をより適切に保持し、推論段階でより自然な動画を生成できます。

AnyCharVのプロジェクトアドレス

AnyCharV アプリケーションシナリオ

  • 映画およびテレビ制作この機能を使えば、任意のキャラクターをターゲットシーンに合成でき、複雑なインタラクションをサポートし、特殊効果の制作にも役立ちます。
  • 芸術創作テキストベースのコンテンツを組み合わせることで、高品質なキャラクター動画を素早く作成し、創造性を刺激します。
  • バーチャルリアリティキャラクターと仮想シーンの間でリアルタイムのインタラクティブな動画を生成し、没入感を高める。
  • 広告とマーケティング多様なニーズに対応するため、パーソナライズされた広告動画を迅速に作成します。
  • 教育と訓練教育や研修を支援するために、特定のキャラクターやシナリオをフィーチャーした動画を作成する。