AB
AiBoss
project

LLIA - Meituanの音声駆動型ポートレート動画生成フレームワーク

LLIA(Low-Latency Interactive Avatars)は、Meituanが開発した、拡散モデルに基づくリアルタイム音声駆動型ポートレートビデオ生成フレームワークです。このフレームワークは、音声入力に基づいて仮想アバターを生成し、低遅延をサポートしています。

LLIAとは何ですか?

LLIA(Low-Latency Interactive Avatars)は、Meituanが開発した、拡散モデルに基づくリアルタイム音声駆動型ポートレート動画生成フレームワークです。このフレームワークは、音声入力に基づいて仮想アバターを生成し、低遅延かつ高忠実度のリアルタイムインタラクションをサポートします。LLIAは、可変長動画生成技術を用いて初期動画生成の遅延を低減し、一貫性モデル学習戦略とモデル量子化技術を組み合わせることで推論速度を大幅に向上させています。LLIAは、カテゴリラベルを用いて仮想アバターの状態(発話、聴取、待機など)や表情をきめ細かく制御できるため、ユーザーにスムーズで自然なインタラクティブ体験を提供します。

LLIAの主な機能

  • リアルタイム音声駆動ポートレートビデオ生成入力された音声信号に基づいて、対応するポートレート動画をリアルタイムで生成し、音声、表情、動きの同期を実現します。
  • 低遅延インタラクション高性能GPU上で高フレームレート(例えば、384×384解像度で78FPS)かつ低遅延(例えば、140ms)のビデオ生成を実現できるため、リアルタイムのインタラクティブなシナリオに適しています。
  • 複数状態切り替えこの機能により、会話中、聞いている状態、待機状態などのカテゴリタグに基づいて仮想アバターの状態を制御することができ、仮想アバターがシーンに応じて自然に反応することが可能になります。
  • 顔の表情制御ポートレートアニメーション技術に基づき、参照画像の表情を修正することで、生成される動画における表情を細かく制御し、仮想アバターの表現力を向上させる。

LLIA技術原則

  • 拡散モデルフレームワークLLIAは、強力な生成能力と高忠実度出力を基盤とした拡散モデルを基本アーキテクチャとして採用しています。拡散モデルは、ノイズを段階的に除去することで画像や動画を生成します。
  • 可変長ビデオ生成LLIAは、モデルが推論中に異なる長さのビデオクリップを生成できるようにする動的なトレーニング戦略を導入し、ビデオ品質を維持しながら遅延を削減します。
  • 一貫性モデルLLIAは、一貫性モデルと識別器を導入することで、より少ないサンプリングステップで高品質なビデオ生成を実現し、推論速度を大幅に向上させています。
  • モデルの量子化と並列化モデルの推論性能をさらに最適化し、計算リソースの要件を削減するために、モデル量子化(INT8量子化など)とパイプライン並列処理技術を使用します。
  • 条件付き入力と制御LLIAは、カテゴリタグとポートレートアニメーション技術に基づいて、入力音声の特性に応じて仮想アバターの状態と表情を動的に調整し、自然なインタラクティブ効果を実現します。
  • 高品質なデータセットLLIAは、オープンソースデータ、ネットワークで収集されたデータ、合成データなど、100時間以上の高品質なデータセットを使用してトレーニングされており、さまざまなシナリオにおけるモデルのパフォーマンスを向上させています。

LLIAプロジェクトの住所

LLIAの応用シナリオ

  • バーチャル面接リアルタイムの表情やジェスチャーに基づいて、仮想の面接官や求職者を生成し、面接のリアリティとインタラクティブ性を向上させます。
  • モバイルチャットボットこの技術は、チャットボットに鮮やかな仮想アバターを提供し、音声入力に基づいてリアルタイムで表情や動作を生成することで、ユーザーとのインタラクション体験を向上させます。
  • バーチャルカスタマーサービス顧客の音声メッセージにリアルタイムで応答し、自然な表情やジェスチャーで顧客満足度を向上させる仮想カスタマーサービス担当者を生成します。
  • オンライン教育このシステムは仮想の教師や教育補助者を生成し、授業内容や生徒のフィードバックに基づいて表情や動作をリアルタイムで調整することで、授業のインタラクティブ性を向上させます。
  • バーチャルソーシャルユーザー向けに仮想アバターを生成し、音声を通じて表情や動作を制御できるようにすることで、よりリアルで自然なソーシャル体験を実現します。