AB
AiBoss
project

Hallo - 復旦大学、百度などが開発した、オープンソースのAIリップシンクポートレート動画生成フレームワーク。

Halloは、復旦大学、百度、チューリッヒ工科大学、南京大学の研究者らが共同で提案した、AIを活用したリップシンクポートレート画像アニメーション技術です。音声入力に基づいて、リアルでダイナミックな画像を生成できます。

Halloとは何ですか?

Halloは、復旦大学、百度、チューリッヒ工科大学、南京大学の研究者による共同研究プロジェクトであり、音声入力に基づいてリアルでダイナミックなポートレート画像と動画を生成する、AI搭載のリップシンクポートレートアニメーション技術です。このフレームワークは、拡散ベースの生成モデルと階層的な音声駆動型ビジュアル合成モジュールを採用し、音声と映像出力の同期精度を向上させています。Halloのネットワークアーキテクチャは、UNetデノイザー、時間軸アライメント技術、および参照ネットワークを統合することで、アニメーションの品質とリアリティを高め、画像と動画の品質を大幅に向上させるだけでなく、リップシンク精度を高め、動きの多様性も高めています。

ハローの特徴

  • 音声同期アニメーションHalloは、高度な音声分析技術を用いて、入力された音声データとポートレート画像を組み合わせることで、ダイナミックな顔アニメーションを生成します。高精度なリップシンクアルゴリズムにより、動画アニメーションの唇の動きと音声が同期し、リアルな話し声を実現します。
  • 顔の表情生成Halloは、音声信号に含まれる感情や音色の変化に基づいて、笑顔、しかめっ面、驚きといった対応する表情を自動的に認識・生成することができ、動画内のアニメーションキャラクターの「演技」をより自然で感情豊かなものにします。
  • 頭部姿勢制御Halloは、ビデオアニメーションにおける頭部の姿勢(頭部の傾きや回転など)を微調整することを可能にし、ビデオアニメーションが音声コンテンツの意図や感情をより的確に反映し、視覚と聴覚の協調性を向上させることを可能にします。
  • パーソナライズされたアニメーションのカスタマイズユーザーは、さまざまなアプリケーションシナリオや個人の特性に基づいて、アニメーションのスタイル、表情、動きをカスタマイズできます。Halloのパーソナライゼーション機能により、ユーザーは特定の視覚的および感情的な表現ニーズを満たす独自のキャラクターを作成できます。
  • 時間的一貫性の維持Halloは、アニメーションにおける動作や表情のスムーズな移行を実現し、唐突で不自然な変化を回避するために、時間軸調整技術を使用しています。
  • 動きの多様性Halloは基本的な音声同期に加え、様々な動きやスタイルの生成にも対応しています。ユーザーは必要に応じて異なるモーションライブラリを選択することで、ジェスチャーや瞬きなど、アニメーションキャラクターにさらにダイナミックな要素を追加し、動画の表現力を高めることができます。

ハローの公式サイト入口

ハローの技術原則

  • レイヤー化された音声駆動型ビジュアル合成Halloは、音声情報と映像情報を処理するために階層的なアプローチを採用しています。この階層構造により、モデルは唇の動き、表情、頭の姿勢を個別に処理し、適応的な重み付けを用いてこれらの要素を融合させることができます。
  • エンドツーエンド拡散モデルHalloは、潜在空間からデータを生成する手法である拡散ベースの生成モデルを使用しています。トレーニング段階では、データに徐々にノイズが追加され、その後、逆のプロセスでノイズが除去されて鮮明な画像が再構築されます。
  • クロスアテンションメカニズムHalloは、相互注意機構を通じて、音声特徴と視覚特徴の間の関連性を確立することができます。この機構により、モデルは現在の音声入力に最も関連性の高い顔領域に注意を集中させることができます。
  • UNetノイズリダクションHalloは、UNetベースのノイズ除去技術を用いて画像からノイズを段階的に除去し、鮮明なアニメーションフレームを生成します。UNetアーキテクチャは、画像セグメンテーションタスクにおける有効性で知られており、スキップ接続による低レベル特徴マップの利用によって生成品質を向上させています。
  • 時刻合わせ技術アニメーションの連続性を維持するために、Halloはタイムアライメント技術を使用しており、これにより連続するフレーム間のスムーズな遷移と一貫性が確保されます。
  • リファレンスネットReferenceNetは、一貫性があり制御可能なキャラクターアニメーションを実現するために、グローバルな視覚テクスチャ情報をエンコードするために使用されます。これにより、モデルは生成プロセス中に既存の画像を参照することができ、出力の視覚品質が向上します。
  • 顔認識および音声エンコーダーHalloは、事前学習済みの顔エンコーダーを使用して肖像写真から人物の特徴を抽出し、同時に音声特徴エンコーダー(wav2vecなど)を使用して音声信号をアニメーションの動きを駆動できる情報に変換します。
  • 適応型重量調整Halloでは、唇、表情、ポーズなどのさまざまな視覚要素の重みを調整することで、アニメーションの多様性と詳細さを制御できます。
  • 訓練と推論トレーニング中、Halloは顔画像エンコーダーと空間クロスアテンションモジュールのパラメータを最適化することで、単一フレーム生成能力を向上させます。推論時には、モデルは参照画像と駆動音声を組み合わせてアニメーションビデオシーケンスを生成します。