project
ACTalker - 香港科技大学、テンセント、清華大学が共同で立ち上げた、エンドツーエンドの動画配信フレームワーク。
ACTalkerは、リアルな話者ヘッド動画を生成するためのエンドツーエンドの動画拡散フレームワークです。音声や表情など、単一信号または複数信号の制御をサポートします。コアアーキテクチャには、複数のブランチを利用して並列Mamba構造を採用しています。
ACTalkerとは何ですか?
ACTalkerは、リアルな話者頭部動画を生成するためのエンドツーエンドの動画拡散フレームワークです。音声や表情など、単一信号または複数信号の制御をサポートしています。コアアーキテクチャは並列Mamba構造を採用しており、複数のブランチを使用して異なる駆動信号で顔領域を個別に制御します。ゲーティング機構とマスク破棄戦略に基づき、柔軟で自然な動画生成を実現します。CelebV-HQデータセットにおいて、ACTalkerはSync-Cスコア5.317、Sync-Dスコア7.869という優れたスコアと、FVD-Incスコア232.374を記録し、良好な音声同期と動画品質を実現しています。
ACTalkerの主な機能
- マルチ信号制御とシングル信号制御ACTalkerはマルチシグナル制御とシングルシグナル制御の両方をサポートしており、音声や表情などの様々な信号を使用して、話者の頭部の映像を生成することができます。
- 自然で調和のとれたビデオ生成Mambaアーキテクチャは、各ブランチにおいて駆動信号が時間的および空間的に特徴マーカーを操作することを可能にし、制御されたビデオの自然な時間的および空間的協調を保証します。
- 高品質なビデオ生成実験結果によると、ACTalkerは自然でリアルな顔認識動画を生成できることが示されています。マルチシグナル制御下では、Mambaレイヤーは複数の駆動方式をシームレスに統合し、競合のない動画を生成できます。
ACTalkerの技術原理
- 並列マンバ構造ACTalkerは、複数のブランチを含む並列Mambaアーキテクチャを採用しています。各ブランチは、音声や表情などの個別の駆動信号を使用して、特定の顔領域を制御します。これにより、異なるモダリティからの信号が干渉することなくビデオ生成プロセスに同時に作用し、マルチ信号制御を実現します。
- ゲーティング機構ゲーティング機構はすべての分岐に適用され、トレーニング中はランダムに有効または無効にされ、推論中は必要に応じて手動で調整されます。このゲーティング機構により、ビデオ生成を柔軟に制御でき、さまざまな状況下でプロセスを駆動するための単一または複数の信号を選択できます。
- マスクドロップ戦略ACTalkerはマスク破棄戦略を導入し、各駆動信号が対応する顔領域を独立して制御できるようにします。トレーニング中、この戦略は駆動信号の有効性を高め、生成されるコンテンツの品質を向上させ、制御領域に関係のない特徴ラベルをランダムに破棄することで制御の競合を防ぎます。
- 状態空間モデリング(SSM)ACTalkerは、制御された動画において自然な時間的・空間的協調を実現するために、状態空間モデリング(SSM)を採用しています。このモデルにより、各ブランチにおいて、駆動信号を用いて特徴マーカーを時間的・空間的両面から操作することが可能となり、自然な顔の動きの協調を実現します。
- 動画拡散モデルの基礎ACTalkerはビデオ拡散モデルに基づいて構築されており、ノイズ除去処理中にマルチブランチ制御モジュールを導入しています。各Mambaブランチは特定のモダリティ信号を処理し、各モダリティの影響重みはゲーティング機構によって動的に調整されます。
ACTalkerのプロジェクトアドレス
- プロジェクト公式サイト:https://harlanhong.github.io/publications/actalker
- GitHubリポジトリ:https://github.com/harlanhong/ACTalker
- ハギングフェイスモデルライブラリ:https://huggingface.co/papers/2504.02542
- arXiv技術論文:https://arxiv.org/pdf/2504.02542
ACTalkerのアプリケーションシナリオ
- バーチャルストリーマーACTalkerは、音声や表情などの様々な信号を通して、自然で滑らかな話し顔の動画を生成することができ、バーチャルアンカーをより生き生きとリアルにし、視聴者とのより良いインタラクションを実現し、視聴者の視聴体験を向上させます。
- リモート会議ACTalkerは、リモート会議において、音声信号と参加者の表情を用いて自然な話し顔動画を生成できます。これにより、ネットワーク遅延による口の動きのずれを解消し、映像信号が不安定な場合でも、参加者は音声と表情を用いて自然な顔動画を生成できるため、リモートコミュニケーションのリアリティが向上します。
- オンライン教育オンライン教育の場面では、教師はACTalkerを使って自然な話し顔動画を作成できます。音声と表情をコントロールすることで、授業動画をより生き生きと面白くし、生徒の注意を引きつけ、教育効果を高めることができます。
- 仮想現実と拡張現実ACTalkerは、仮想現実(VR)および拡張現実(AR)アプリケーションにおいて、仮想環境または拡張現実シーンに合わせた話し顔動画を生成できます。
- エンターテインメントとゲームエンターテインメントおよびゲーム業界において、ACTalkerはキャラクターの自然な話し声の動画を生成し、キャラクターの表現力と没入感を高めることができます。