AB
AiBoss
project

Hallo3 - 復旦大学と百度が共同でオープンソース化した、高ダイナミックレンジかつリアルなポートレートアニメーション生成フレームワーク。

Hallo3は、復旦大学と百度が共同開発した、拡散変換ネットワーク(DTN)に基づくポートレート画像アニメーション技術であり、非常にダイナミックでリアルな動画を生成できます。Hallo3は…

Hallo3とは何ですか?

復旦大学と百度が共同開発したHallo3は、拡散変換ネットワーク(DTN)をベースとしたポートレート画像アニメーション技術で、非常にダイナミックでリアルな動画を生成します。事前学習済みの変換動画生成モデルに基づき、Hallo3は、正面以外の視点の処理、動的なオブジェクトのレンダリング、没入感のある背景の生成といった、既存手法の課題を効果的に解決します。Hallo3は、独自の動画バックボーンネットワークとアイデンティティ参照ネットワークを活用し、動画シーケンス全体にわたって顔のアイデンティティの一貫性を確保します。また、音声オーディオ条件とモーションフレームメカニズムを研究し、音声オーディオを駆動する連続的な動画生成を実現します。実験結果は、Hallo3が複数の向きでリアルなポートレートを生成し、複雑なポーズや動的なシーンに適応し、リアルで滑らかなアニメーション効果を生み出すことに優れていることを示しています。

Hallo3の主な機能

  • マルチビューアニメーション生成この技術は、正面、側面、上空、ローアングルなど、さまざまな視点からアニメーションポートレートを生成することで、正面からの視点に主に依存する従来の手法の限界を打ち破ります。
  • 動的オブジェクトレンダリングこの技術は、人物がスマートフォンやマイクを持っている、あるいは体にぴったりとフィットする服を着ているなど、人物像の周囲にある動的なオブジェクトのアニメーションを処理し、ビデオシーケンス内でオブジェクトのリアルな動きを生成します。
  • 没入型の背景生成映像のリアリティと没入感を高めるために、前景に焚き火、背景に混雑した街並みなど、ダイナミックな効果を持つ背景を生成します。
  • アイデンティティの一貫性を維持する動画シーケンス全体を通して肖像画の同一性を維持し、長時間のアニメーションにおいても顔の特徴を正確に識別・保持します。
  • 音声アニメーション音声データに基づいて人物の表情や口の動きを制御し、音声と表情のアニメーションを高度に同期させることで、より自然でリアルなアニメーションを実現します。

Hallo3の技術的原理

  • 事前学習済みのTransformerビデオ生成モデル
    • インフラストラクチャーCogVideoXモデルは、3D変分オートエンコーダー(VAE)を用いてビデオデータを圧縮する基盤となるアーキテクチャです。このモデルは、潜在変数とテキスト埋め込みを組み合わせ、エキスパートトランスフォーマーネットワークに基づいて処理します。
    • 条件付きメカニズムテキストプロンプト(ctext)、音声条件(caudio)、および本人確認条件(cid)という3つの条件メカニズムが導入されています。これらの条件情報は、主にクロスアテンションと適応型レイヤー正規化(adaLN)を用いて統合されます。
  • アイデンティティ参照ネットワーク
    • 3D VAEとトランスフォーマーレイヤー我々は、因果関係に基づく3D VAEと42層のアイデンティティ参照ネットワークを組み合わせ、参照画像からアイデンティティ特徴を抽出し、ノイズ除去潜在コードに埋め込みます。自己注意機構に基づき、モデルのアイデンティティ情報の表現力と長期保持能力を向上させます。
    • 機能融合参照ネットワークによって生成された視覚的特徴は、ノイズ除去ネットワークの特徴と融合され、生成される顔アニメーションが長時間のシーケンスにわたって一貫性と整合性を維持するようにする。
  • 音声オーディオ条件
    • 音声埋め込みwav2vecフレームワークは、音声特徴を抽出し、フレーム固有の音声埋め込みを生成し、線形変換レイヤーに基づいて、音声埋め込みをモデルに適した表現に変換します。
    • 相互注意メカニズムノイズ除去ネットワークでは、クロスアテンション機構が音声埋め込みと潜在符号化と相互作用し、生成される出力の一貫性と関連性を高め、モデルが文字生成を促す音声信号を効果的に捉えることを保証します。
  • ビデオ外挿モーションフレームを条件情報として導入する:生成されたビデオの最後の数フレームを、後続のセグメント生成の入力として使用します。モーションフレームは3D VAEを使用して処理され、新しい潜在コードが生成されることで、時間的に一貫性のある長尺ビデオ推論が可能になります。
  • 訓練と推論
    • トレーニングプロセスこのプロセスは2つのフェーズに分かれています。第1フェーズでは、一貫したアイデンティティを持つ動画を生成するようにモデルを訓練します。第2フェーズでは、音声アテンションモジュールを統合することで、音声駆動型の動画生成へと拡張します。
    • 推論プロセスこのモデルは、参照画像、駆動音声、テキストプロンプト、およびモーションフレームを入力として受け取り、同一性を保ち、口の動きが同期したビデオを生成します。

Hallo3のプロジェクトアドレス

Hallo3の応用シナリオ

  • ゲーム開発ゲーム内のキャラクターにダイナミックなポートレートアニメーションを生成することで、キャラクターの動きをより自然でリアルにし、プレイヤーのゲーム体験を向上させます。
  • 映画製作映画やアニメーションの視覚効果と没入感を高めるために、リアルなキャラクターアニメーションを生成します。
  • ソーシャルメディアソーシャルメディアユーザー向けに動的なアバターを生成することで、プロフィールをより鮮やかで魅力的なものにし、ソーシャルメディア上でのパーソナライズされた体験を向上させます。
  • オンライン教育アニメーション化された仮想講師を生成することで、オンラインコースをより生き生きと興味深いものにすることができ、それによって学生の学習意欲と参加度を高めることができる。
  • 仮想現実と拡張現実VRおよびARアプリケーションにおいて仮想キャラクターを生成することで、よりリアルなインタラクティブ体験を提供し、ユーザーの没入感とエンゲージメントを高める。