AB
AiBoss
project

MirrorMe - Alitongyiがリリースした音声駆動型ポートレートアニメーションフレームワーク

MirrorMeは、アリババ同義研究所が開発した、リアルタイムかつ高忠実度の音声駆動型ポートレートアニメーションフレームワークです。LTXビデオモデルをベースに、このフレームワークは、アイデンティティ注入メカニズム、音声駆動型制御モジュール、プログレッシブトレーニング戦略という3つの重要なイノベーションを組み込んでいます。

MirrorMeとは何ですか?

MirrorMeは、アリババ傘下のTongyi Labが開発した、リアルタイムかつ高忠実度の音声駆動型ポートレートアニメーションフレームワークです。LTXビデオモデルをベースに、アイデンティティ注入メカニズム、音声駆動型制御モジュール、プログレッシブトレーニング戦略という3つの重要なイノベーションを組み込むことで、高忠実度かつ時間的に一貫性のあるアニメーションビデオをリアルタイムで生成するという課題に取り組んでいます。MirrorMeはEMTDベンチマークでトップの成績を収め、優れた画像忠実度、リップシンク精度、時間的安定性を実証しました。高い推論速度を誇り、リアルタイム生成の要件を満たし、eコマースのライブストリーミングなどのアプリケーションに強力な技術サポートを提供します。

MirrorMeの主な機能

  • リアルタイム高精細アニメーション生成MirrorMeは、リアルタイムで高品質な上半身アニメーション動画を生成し、24FPSでのスムーズな再生をサポートすることで、リアルタイムインタラクションのニーズに対応します。
  • 音声連動型リップシンクMirrorMeは音声信号を正確に対応する唇の動きに変換し、非常にリアルなリップシンクを実現します。
  • 身元保護MirrorMeは、参照画像への識別子挿入メカニズムを使用して、生成されるアニメーションビデオが入力参照画像と外観的に非常に一致するようにします。
  • 正確な表情とジェスチャーの制御MirrorMeは、顔の表情を制御したり、ジェスチャー信号に基づいて手の動きを正確に制御したりすることができます。

MirrorMeの技術原則

  • インフラストラクチャーコアアーキテクチャはLTXビデオモデルに基づいています。LTXモデルは、拡散トランスフォーマーに基づくビデオ生成モデルであり、時空間トークン化(各トークンは32×32×8ピクセルに対応)を使用して、非常に高い圧縮率(1:8192)を実現します。
  • アイデンティティ注入メカニズムMirrorMeは、生成される動画が入力参照画像と外観的に酷似するように、参照アイデンティティ注入メカニズムを採用しています。参照画像は、LTXモデルの3D変分オートエンコーダー(VAE)を用いてエンコードされ、参照潜在空間変数が生成されます。これらのエンコードされた潜在空間変数は、時間経過とともにノイズを含む潜在空間変数と連結され、自己注意機構に基づいてアイデンティティ情報が注入されます。これにより、生成される動画が参照画像との視覚的な一貫性を維持することが保証されます。
  • オーディオドライバ制御モジュールこのシステムは、オーディオドライバ制御モジュールに基づいて、音声信号と映像生成の正確な同期を実現します。具体的な実装は以下のとおりです。
    • 因果関係オーディオエンコーダー事前学習済みのwav2vec2モデルを使用して、元の音声信号からフレームレベルの音声埋め込みを抽出し、因果的音声エンコーダに基づいて音声シーケンスを段階的に圧縮して、時間分解能をビデオの潜在空間変数に一致させます。
    • オーディオアダプター抽出された音声特徴は、オーディオアダプタを介してビデオ生成プロセスに組み込まれます。オーディオアダプタは、相互注意機構に基づいて音声とビデオの特徴を融合し、音声信号が顔の表情や唇の動きを正確に制御できるようにします。
  • 段階的なトレーニング戦略MirrorMeは、モデルの学習効果と生成品質を向上させるため、段階的な学習戦略を採用しています。まず、顔のクローズアップ画像を用いて、音声と表情のマッピング関係の学習に重点を置きます。このクローズアップ学習を基盤として、徐々に上半身合成へと拡張し、顔領域の動的な応答を維持するために顔マスキングを導入します。姿勢エンコーダーモジュールは、手の動きを正確に制御するために、主要な手信号を組み込みます。
  • 効率的な推論MirrorMeは、LTXモデルに基づいた効率的な圧縮およびノイズ除去技術を採用することで、推論速度を大幅に向上させています。時間的には入力ビデオを元の長さの1/8に、空間的には高さと幅の両方で元の解像度の1/32に圧縮することで、処理する必要のある潜在空間変数の数を大幅に削減します。コンシューマー向けNVIDIA GPUでは、MirrorMeは24 FPSでのリアルタイム生成を実現し、リアルタイムアプリケーションの厳しいレイテンシ要件を満たします。

MirrorMeプロジェクトのアドレス

  • arXiv技術論文:https://arxiv.org/pdf/2506.22065v1

MirrorMeの応用事例

  • eコマースのライブストリーミング入力された音声に基づいてリアルタイムで自然な表情や動きを生み出す、まるで生きているかのような仮想アンカーを生成することで、ライブ配信のインタラクティブ性と魅力を高めます。
  • バーチャルカスタマーサービスオンラインカスタマーサービスにおいては、生成された仮想カスタマーサービスアバターが音声に基づいてリアルタイムでユーザーと対話し、自然で親しみやすいサービス体験を提供します。また、多言語に対応しており、様々な言語背景を持つユーザーにも対応可能です。
  • オンライン教育MirrorMeは、授業内容に基づいて表情や動作をリアルタイムで表示する仮想教師を生成することで、授業をより生き生きと興味深いものにします。また、生徒に似た仮想アバターを生成することで、生徒のニーズに的確に対応した個別学習のための授業コンテンツを提供します。
  • バーチャル会議MirrorMeは、参加者の声に基づいてリアルタイムで表情やジェスチャーを表示する仮想アバターを生成し、会議のインタラクティブ性と参加度を高めます。リモートコラボレーションに適しており、チームメンバー間の対面コミュニケーションの感覚を強化します。
  • ソーシャルメディアユーザーは独自の仮想アバターを作成したり、音声を通じてソーシャルメディア上で交流したり、興味深いビデオコンテンツを共有したり、ライブストリームの楽しさやエンゲージメントを高めたりすることができます。