AB
AiBoss
project

FantasyTalking - アリババと北京郵電大学が共同で、静止画から制御可能なデジタル人間を生成するフレームワークを発表。

FantasyTalkingは、アリババのAMAPチームと北京郵電大学が共同で提案した、単一の静止画像からリアルでアニメーション可能な仮想アバターを生成するための新しいフレームワークです。事前学習済みのビデオ拡散変換モデルに基づいて、...

ファンタジートーキングとは何ですか?

FantasyTalkingは、アリババのAMAPチームと北京郵電大学が共同で提案した、静止画からリアルでアニメーション可能な仮想アバターを生成するための新しいフレームワークです。事前学習済みのビデオ拡散トランスフォーマーモデルをベースとし、2段階のオーディオビジュアルアライメント戦略を採用しています。第1段階では、セグメントレベルのトレーニングスキームを通じて一貫性のあるグローバルな動きを確立し、第2段階では、リップトラッキングマスクを使用してフレームレベルで唇の動きを洗練させ、音声信号との正確な同期を確保します。このフレームワークは、顔の焦点を維持するためのクロスアテンションモジュールと、顔の表情や体の動きの強度を制御するためのモーション強度変調モジュールを導入しています。

FantasyTalkingの主な機能

  • リップシンク仮想キャラクターの唇の動きを入力音声と正確に認識して同期させることができ、キャラクターが話す際の唇の動きを音声の内容と完全に一致させることで、キャラクターのリアリティと信憑性を高めることができます。
  • 顔の動きの生成音声の内容と感情情報に基づいて、瞬き、眉をひそめる、微笑むといった対応する顔の動きが生成され、仮想キャラクターの表情がより豊かで生き生きとしたものになる。
  • 全身モーション生成シーンやストーリーの必要に応じて、歩行、走行、ジャンプなどの全身の動きや姿勢を生成できるため、アニメーションにおける仮想キャラクターをより自然で滑らかなものにすることができる。
  • 運動強度のコントロールモーション強度変調モジュールを使用することで、ユーザーは顔の表情や体の動きの強度を明確に制御でき、唇の動きだけでなく、ポートレートの動きを自在に操作することが可能になります。
  • 複数のスタイルに対応リアルなスタイルから漫画風のスタイルまで、様々なスタイルの仮想アバターに対応しており、高品質な対話動画を生成できます。
  • 複数の姿勢をサポートするクローズアップポートレート、上半身、全身、正面および側面ポーズなど、さまざまな体位や向きでリアルな話し声の動画を生成することをサポートします。

ファンタジートーキングの技術的原理

  • 2段階の視聴覚アライメント戦略
    • 断片レベルのトレーニング最初の段階では、セグメントレベルのトレーニング方式により、モデルは音声とシーン全体(参照ポートレート、コンテキストオブジェクト、背景を含む)との間の弱い相関関係を捉え、グローバルな視聴覚依存関係を確立し、全体的な特徴融合を実現します。これにより、モデルは音声に関連する非言語的キュー(眉の動きや肩の動きなど)や、音声と強く同期した唇の動きを学習できるようになります。
    • フレームレベルのトレーニング第2段階では、モデルはフレームレベルで音声と高い相関関係にある視覚的特徴、特に唇の動きの精緻化に重点を置きます。リップトラッキングマスクを使用することで、唇の動きが音声信号と正確に同期するようにし、生成されるビデオの品質を向上させます。
  • 身元保護従来の参照ネットワーク手法では、動画内の人物や背景の自然な変化が制限されることがよくあります。FantasyTalkingは、顔に焦点を当てたクロスアテンションモジュールを採用し、顔領域を中央集権的にモデリングするとともに、クロスアテンション機構によって人物の同一性保持と動き生成を分離します。これにより処理が軽量化され、背景や人物の自然な動きに対する制約から解放され、生成された動画シーケンス全体を通して人物の同一性が維持されます。
  • 運動強度の調整FantasyTalkingは、顔の表情や体の動きの強度を細かく制御できるモーション強度変調モジュールを搭載しています。これにより、唇の動きだけでなく、ポートレート全体の動きを自在に操作できます。モーション強度を調整することで、より自然で多様なアニメーションを生成可能です。
  • 事前学習済みのビデオ拡散変換モデルに基づくFantasyTalkingは、Wan2.1ビデオ拡散トランスフォーマーモデルをベースに、その時空間モデリング機能を活用することで、高精細で一貫性のある話し手のポートレートビデオを生成します。このモデルは、音声信号と唇の動き、表情、身体の動きとの関係性を効果的に捉え、高品質でダイナミックなポートレートを生み出します。

FantasyTalkingのプロジェクトアドレス

FantasyTalkingの応用事例

  • ゲーム開発ゲーム開発において、FantasyTalkingはゲームキャラクターのセリフや戦闘アニメーションの生成に利用できます。音声コンテンツに基づいて正確なリップシンク、豊かな表情、自然な全身の動きを生成することで、ゲームキャラクターをより生き生きとリアルに表現し、ゲームの視覚効果とプレイヤーの没入感を高めます。
  • 映画およびテレビ制作映画やテレビ制作において、FantasyTalkingは仮想キャラクターのパフォーマンスアニメーションや特殊効果アニメーションの生成に利用できます。FantasyTalkingを使えば、複雑な表情や動きを持つ仮想キャラクターを迅速に生成できるため、従来のアニメーション制作における人員と時間を削減し、映画やテレビ作品にさらなる創造性と想像力を加えることができます。
  • 仮想現実と拡張現実仮想現実(VR)および拡張現実(AR)アプリケーションにおいて、FantasyTalkingは仮想キャラクター向けのインタラクティブでガイド付きのアニメーションを生成できます。
  • バーチャルストリーマーFantasyTalkingは、バーチャルアンカーのアニメーション動画を生成するために使用できます。様々なスタイルのバーチャルアバターに対応しており、ニュース放送、ライブeコマース、オンライン教育など、様々な場面で使用できるため、高い実用性と柔軟性を備えています。
  • スマート教育スマート教育の分野において、FantasyTalkingは仮想教師や仮想教育アシスタントのアニメーション動画を生成することができる。