project
MoCha - Metaは、ウォータールー大学との共同研究により、エンドツーエンドの対話型ロールプレイング動画生成モデルを発表します。
MoCha AIは、Metaとウォータールー大学が共同開発した、対話ベースのエンドツーエンドのキャラクター動画生成モデルです。テキストまたは音声入力に基づいて、同期した音声と自然な動きを伴う完全なキャラクターアニメーションを生成できます。MoChaは音声ビューを採用しています...
MoChaとは何ですか?
MoCha AIは、Metaとウォータールー大学が共同開発した、対話型キャラクター動画生成のためのエンドツーエンドモデルです。テキストまたは音声入力に基づいて、音声と自然な動きが同期した完全なキャラクターアニメーションを生成できます。MoChaは、音声解像度の不一致や動画圧縮時の口の動きのずれといった問題を解決するために、音声・動画ウィンドウ注意機構を採用しています。複数キャラクターによるターン制対話に対応し、感情表現と全身の動きを伴うキャラクターアニメーションを生成できます。
MoChaの主な機能
- 音声によるキャラクターアニメーション生成ユーザーが音声を入力すると、MoChaは音声の内容に同期した唇の動き、表情、ジェスチャー、体の動きを生成することができる。
- テキスト駆動型キャラクターアニメーション生成ユーザーはテキストスクリプトを入力するだけでよく、MoChaがまず音声を自動的に合成し、その後、キャラクターに完全な唇の動きと動作を実行させる。
- 全身アニメーション生成顔の表情や口の形しか生成できない従来のモデルとは異なり、MoChaは唇の動きの同期、ジェスチャー、複数のキャラクター間の相互作用など、自然な全身の動きを生成できます。
- 複数キャラクターによるターン制対話生成MoChaは、構造化されたプロンプトテンプレートとキャラクタータグを提供し、会話のターンを自動的に認識して、キャラクター間の自然なやり取りを可能にします。複数のキャラクターが登場するシナリオでは、ユーザーはキャラクター情報を一度定義するだけで済み、説明を繰り返すことなく、「キャラクター1」や「キャラクター2」といったシンプルなタグを使って、異なるシナリオでこれらのキャラクターを参照できます。
MoChaの技術原則
- 拡散トランス (DiT) アーキテクチャMoChaは、拡散トランスフォーマーアーキテクチャに基づいており、クロスアテンション機構を通してテキストと音声の条件をモデルに順次組み込むことで、意味的および時間的なダイナミクスを効果的に捉えます。キャラクターアニメーションと入力音声の正確な同期を確保しながら、リアルで表現力豊かな全身の動きを生成できます。
- 音声・動画ウィンドウの注意機構動画圧縮や並列生成によって生じる音声と動画の同期の問題に対処するため、MoChaは音声・動画ウィンドウ注意機構を導入しています。この機構は、各動画マーカーが時間的に隣接する音声マーカーのみに焦点を合わせるように制限することで、リップシンクと音声・動画同期の精度を向上させます。人間の発話動作をシミュレートし、登場人物の唇の動きと会話内容の正確な一致を保証します。
- 共同訓練戦略MoChaは、音声注釈付き動画データとテキスト注釈付き動画データの両方を用いて学習を行う、統合学習戦略を採用しています。これにより、多様なキャラクター動作に対するモデルの汎化能力が向上し、自然言語の手がかりを通して、キャラクターの表情、動き、相互作用、そして環境をきめ細かく制御することが可能になります。
- 構造化されたプロンプトテンプレート複数キャラクターが登場する対話のテキスト記述を簡素化するために、MoChaは構造化されたキューテンプレートを設計しました。このテンプレートは各キャラクターに固有のラベルを割り当て、そのラベルはテキスト内でキャラクターの行動ややり取りを説明するために使用されます。これにより冗長性が削減され、複数キャラクターが登場するシナリオにおけるモデルの生成性能が向上します。
- 多段階トレーニングフレームワークMoChaは多段階の学習フレームワークを採用しており、ショットの種類(クローズアップやミディアムショットなど)に基づいてデータを分類し、より複雑なタスクを段階的に導入します。これにより、学習効率を向上させながら、難易度の異なるタスクにおけるモデルのパフォーマンスを確保します。
MoChaのプロジェクトアドレス
- プロジェクト公式サイト:https://congwei1230.github.io/MoCha/
- arXiv技術論文:https://arxiv.org/pdf/2503.23307
Mochaアプリケーションシナリオ
- バーチャルストリーマーMoChaは、日々のVlog、質疑応答セッション、その他のコンテンツを自動生成できます。音声またはテキスト入力により、唇の動き、表情、ジェスチャー、体の動きを同期させて生成し、バーチャルアンカーをより生き生きと自然に見せます。
- アニメーションと映画制作MoChaはAIを活用した自動吹き替えとアニメーション生成をサポートし、アニメーション映画やテレビ番組の制作コストを削減します。全身アニメーションを生成できるため、キャラクターの動きがより自然になり、映画のようなデジタルヒューマンの演技に近づきます。
- 教育コンテンツの作成MoChaはAI教師として機能し、授業を行ったり、インタラクティブなアクティビティに参加したりすることができます。テキストベースの手法を用いて、授業内容に合わせたキャラクターアニメーションを生成し、教材の楽しさと魅力を高めます。
- デジタルヒューマンカスタマーサービスMoChaは、企業の顧客サービスやコンサルティング業務を擬人化するために使用できます。音声またはテキスト入力によって、自然で滑らかな顧客サービス対話アニメーションを生成し、ユーザーエクスペリエンスを向上させます。