AB
AiBoss
project

MultiTalk - 複数人による対話動画を生成するための音声駆動型フレームワーク

MultiTalkは、中山大学深圳キャンパス、美団、香港科技大学が共同開発した、音声駆動型の多人数対話型動画生成フレームワークです。このフレームワークは、マルチチャンネル音声入力、参照画像、テキストプロンプトに基づいて、人間の対話を含む動画を生成します。

MultiTalkとは何ですか?

MultiTalkは、中山大学深圳キャンパス、美団、香港科技大学が共同開発した、音声駆動型の多人数対話型動画生成フレームワークです。このフレームワークは、マルチチャンネル音声入力、参照画像、テキストプロンプトに基づいて、音声に合わせて口の動きが変化するインタラクティブなキャラクターが登場する動画を生成します。マルチチャンネル音声とキャラクターの関連付けという課題に効果的に対処するために、ラベル回転位置埋め込み(L-RoPE)手法を導入し、部分的なパラメータ学習とマルチタスク学習戦略によって、基本モデルの指示追従能力を維持しています。MultiTalkは複数のデータセットで優れた性能を発揮し、強力な動画生成能力を示しており、漫画、歌、指示追従動画など、さまざまなシナリオの生成に適しています。

MultiTalkの主な機能

  • 音声駆動型複数人対話ビデオ生成マルチチャンネル音声入力、参照画像、およびテキストプロンプトに基づいて、複数人によるインタラクションとリップシンクを特徴とするビデオを生成します。
  • 音声と文字のバインディングの問題を解決するjiyu Label Rotary Position Embedding (L-RoPE) 方式は、マルチチャンネルオーディオを文字にバインドする際の問題を効果的に解決し、オーディオが誤った文字にバインドされることを回避します。
  • 強力なコマンド追従機能部分的なパラメータ学習とマルチタスク学習戦略に基づき、基本モデルの指示に従う能力を維持しつつ、テキストプロンプトに応じて要件を満たすビデオコンテンツを生成する。

MultiTalkの技術原理

  • 音声駆動型ビデオ生成フレームワークMultiTalkは、Diffusion-in-Transformer(DiT)に基づくビデオ拡散モデルを基盤として採用しています。このアーキテクチャは、3D変分オートエンコーダー(VAE)を組み合わせてビデオの時空間次元を圧縮し、効率的にビデオコンテンツを生成します。拡散モデルの逆処理に基づき、ノイズからビデオコンテンツが徐々に再構築されます。3D VAEはビデオのエンコードとデコードに使用され、ビデオフレームを低次元空間に圧縮することで、モデル処理を容易にします。
  • 音声特徴抽出音声の特徴と動画コンテンツを組み合わせるために、MultiTalkは音声クロスアテンション機構を導入しています。音声の特徴はWav2Vecを使用して抽出され、時間的に圧縮された後、動画のフレームレートに合わせられます。各DiTブロックに音声クロスアテンションレイヤーが追加され、動画生成プロセスが音声の特徴に基づいて動画コンテンツを動的に調整できるようになります。
  • Label Rotary Position Embedding (L-RoPE)動画内の人物と背景にそれぞれ異なるタグ範囲を割り当てます。回転位置埋め込み技術に基づき、タグ情報を音声と動画の特徴に統合することで、音声と人物の正確な関連付けを保証します。
  • 適応型キャラクター配置動画内の各人物の位置を動的に追跡するために、適応型人物位置特定手法が用いられます。モデルは、参照画像と生成された動画の自己注意マップに基づいて、各人物の位置を自動的に識別し、正確な音声バインディングを実現します。
  • トレーニング戦略第1段階では1人アニメーションに焦点を当て、第2段階では複数人アニメーションを扱います。部分的なパラメータ学習中は、音声クロスアテンション層と音声アダプタのパラメータのみが更新され、その他のネットワークパラメータは固定され、基本モデルの指示追従能力が維持されます。
  • マルチタスクトレーニング音声から画像、そして動画への変換(AI2V)タスクと画像から動画への変換(I2V)タスクを組み合わせ、異なるデータセットで学習させることにより、モデルの全体的なパフォーマンスを向上させることができます。

MultiTalkのプロジェクトアドレス

MultiTalkアプリケーションシナリオ

  • 映画とエンターテイメントアニメーション映画、特殊効果制作、ゲームのカットシーンなどで使用でき、複数人による対話やインタラクティブなシーンを生成し、制作効率と視覚効果を向上させ、視聴者の没入感を高めることができます。
  • 教育と訓練オンライン教育、バーチャル教室、語学学習などの分野では、実際の対話やコミュニケーションの場面をシミュレートするインタラクティブな教育ビデオが作成され、それによって学習効果と学習意欲が向上している。
  • 広告とマーケティング広告効果を高め、顧客サービスの効率と品質を向上させ、製品プロモーションを促進するために、製品デモンストレーションビデオ、バーチャルカスタマーサービスインタラクティブビデオなどを制作する。
  • ソーシャルメディアとコンテンツ制作ユーザーの注目と共有を促し、コンテンツの楽しさとインタラクティブ性を高め、ユーザーの定着率を向上させるために、創造的な複数人による対話動画やバーチャルライブ配信などを作成する。
  • インテリジェントサービスこの技術は、インテリジェントな顧客サービスやバーチャルアシスタントなどの分野に応用でき、自然で滑らかなインタラクティブ動画を生成し、より人間味のあるサービス体験を提供し、ユーザー満足度を向上させることができます。