AB
AiBoss
project

TANGO - 東京大学とサイバーエージェントAIラボが、音声認識による全身ジェスチャー動画生成フレームワークを発表。

TANGOは、東京大学とサイバーエージェントAIラボが共同開発したオープンソースフレームワークで、対象者の発話と同期した全身ジェスチャー動画の生成に特化しています。階層型オーディオモーション埋め込みと拡散補間ネットワークに基づいて、対象者の発話を同期させ、…

タンゴとは何ですか?

TANGOは、東京大学とサイバーエージェントAIラボが共同開発したオープンソースフレームワークで、ターゲット音声と同期した全身ジェスチャー動画の生成に特化しています。階層型音声モーション埋め込みと拡散補間ネットワークに基づき、ターゲット音声と参照動画ライブラリ内の動作を完璧にマッチングさせることで、高忠実度で同期のとれた動画制作を実現します。TANGOの技術革新は、ニュース放送、バーチャルナレーション、バーチャルYouTubeコンテンツ制作など、動画コンテンツ制作コストを大幅に削減し、ユーザーに効率的かつ費用対効果の高いソリューションを提供します。

TANGOの主な機能

  • 音声による全身ジェスチャー生成対象の音声と同期した全身ジェスチャー動画を生成します。
  • 高精細ビデオ制作生成される動画は、高精細で、自然な動きがあり、音声コンテンツと正確に一致するようにしてください。
  • 異種モダリティ間の連携階層型オーディオモーション埋め込み技術に基づき、音声信号と映像の動きを正確に同期させる。
  • 遷移フレーム生成高品質なトランジションフレームは、拡散補間ネットワークを用いて生成され、ビデオの動きの連続性を確保します。
  • 外観の一貫性を維持する視覚的な不整合を避けるため、生成される動画においても、参照動画と同じ人物や背景の外観を維持してください。

TANGOの技術原則

  • レイヤードオーディオモーション埋め込み(AuMoCLIP)暗黙的な階層型音声・動作結合埋め込み空間を用いて、音声データと動作データをペアにして符号化する。対照学習に基づき、音声データと動作データを共通の潜在空間にマッピングすることで、一致する音声と動作を空間的に近づけ、正確な動作検索を実現する。
  • 拡散補間ネットワーク(ACInterp)このネットワークは、既存のビデオ生成拡散モデルに基づいており、高品質な遷移フレームを生成するために使用されます。生成されたビデオと参照ビデオ間の視覚的な一貫性を維持するために、参照モーションモジュールとホモグラフィ背景ストリームが含まれています。これにより、従来のストリームベースの補間方法でよく見られるぼやけやゴースト現象を効果的に排除できます。
  • アクショングラフ検索方法TANGOは、単純な音声開始特徴量やキーワードマッチングではなく、学習ベースのアプローチを用いて、対象となる音声に最もよく一致する動作経路を取得します。これにより、異なる話者の動作が音声開始と同期していない状況にも適切に対応でき、参照動画に特定のキーワードが含まれていないという問題も解決できます。
  • グラフ構造TANGOは、有向グラフ構造を用いてビデオフレーム(ノード)とそれらの間の有効な遷移(エッジ)を表現します。ターゲットとなる音声が与えられると、システムは時間的特徴を抽出し、これらの特徴を用いてビデオ再生パスのサブセットを取得します。元の参照ビデオに遷移エッジが存在しない場合は、ACInterpを用いて滑らかな遷移フレームを生成します。

TANGOプロジェクトの住所

TANGOの応用事例

  • ニュース放送ニュースリリースと同期した全身ジェスチャー動画を生成することで、ニュース放送の自然さを向上させ、視聴者の視聴体験を高めます。
  • バーチャルユーチューバーバーチャルYouTuber向けに、音声と同期した全身モーションビデオを作成し、ファンとの交流とエンゲージメントを高めます。
  • オンライン教育教育コンテンツを作成する際、TANGOは教師の全身ジェスチャー動画を生成することで、遠隔授業をより鮮やかで効果的なものにします。
  • 企業研修企業研修ビデオに同期したジェスチャーを加えることで、学習教材の魅力を高め、情報伝達の効率を向上させることができる。
  • ビデオ会議ビデオ会議において、TANGOを用いたジェスチャー生成ビデオは、参加者のコミュニケーション体験を向上させることができ、特に遠隔地での共同作業において効果的です。