project
ARTalk - 東京大学などが開発した3Dヘッドアニメーション生成フレームワーク。
ARTalkは、東京大学と理化学研究所が共同開発した、音声駆動型の斬新な3D頭部アニメーション生成フレームワークです。自己回帰モデルに基づき、リアルタイムで高度に同期した唇の動き、自然な表情、頭部の姿勢を実現します。
ARTalkとは何ですか?
ARTalkは、東京大学と理化学研究所が共同開発した、音声駆動型の革新的な3Dヘッドアニメーション生成フレームワークです。自己回帰モデルに基づき、リアルタイムかつ高精度な唇の動きと自然な表情、そして頭部の姿勢を実現します。ARTalkは、マルチスケールモーションコードブックとスライディングタイムウィンドウ技術を音声入力と組み合わせることで、高品質なアニメーションシーケンスを生成します。また、スタイルエンコーダーを導入することで、未知の話し方にも対応し、個性豊かな3Dアニメーションを生成します。ARTalkは、唇の同期精度、表情の自然さ、スタイルの一貫性において既存技術を凌駕し、バーチャルリアリティ、ゲームアニメーション、ヒューマンコンピュータインタラクションなどに適したリアルタイム性能を提供します。
ARTalkの主な機能
- 自然な3D顔アニメーションをリアルタイムで生成します。あらゆる音声クリップから、高度に同期した唇の動き、表情、頭の姿勢を生成します。仮想現実、ゲームアニメーション、映画制作、ヒューマンコンピュータインタラクションなどの分野に適しています。
- パーソナライズされたスタイルへの適応サンプル動作シーケンスに基づいてスタイル特徴を抽出し、独自の個人スタイルを持つ3Dアニメーションを生成します。これにより、トレーニングで見られないアイデンティティやスタイルに対しても高いパフォーマンスを発揮できます。
- マルチスケールモーション生成粗い動きから細かい動きまでを捉え、生成されるアニメーションが様々な時間スケールにおいて自然で一貫性のあるものとなるようにします。
- 低遅延と高効率自己回帰モデルとスライディングタイムウィンドウ技術に基づいており、拡散モデルの高い計算コストを回避しながら、高速なリアルタイムアニメーション生成を可能にし、リアルタイムアプリケーションに適しています。
ARTalkの技術原則
- マルチスケールVQオートエンコーダーモーションシーケンスをマルチスケール離散コードブックにエンコードすることで、異なる時間スケールにおけるモーション特徴を捉え、モーション表現のコンパクト性を向上させる。時系列の一貫性を確保するために、因果マスクが使用される。
- 自己回帰発生器Transformerアーキテクチャに基づき、現在の時間ウィンドウの音声特徴と前のウィンドウの動き情報を組み合わせ、段階的にマルチスケールの動きコードブックを生成することで、生成された動作が音声と密接に一致し、時間的な一貫性を維持することを保証します。
- スタイルエンコーダーサンプル動作シーケンスからスタイルの特徴を抽出することで、音声と動作間の複雑なマッピングの次元を削減し、モデルがパーソナライズされたスタイルのアニメーションを生成できるようにする。
- スライディング時間ウィンドウリアルタイム処理を確実にするため、音声は処理のために時間ウィンドウに分割され、時間的な不連続性を回避するためにウィンドウ間自己回帰メカニズムが使用されます。
- FLAMEモデル3D顔面表現の基盤として、複雑なメッシュの動きを低次元のパラメトリック表現に変換することで、顔や動きのディテールを維持しながら、モーションモデリングの複雑さを簡素化します。
ARTalkのプロジェクトアドレス
- プロジェクト公式サイト:https://xg-chu.site/project_artalk/
- arXiv技術論文:https://arxiv.org/pdf/2502.20323
ARTalk アプリケーションシナリオ
- 仮想現実(VR)と拡張現実(AR)仮想キャラクターの没入感を高めるため、リアルタイムで顔の表情アニメーションを生成する。
- ゲーム開発ゲーム体験を向上させるため、NPCやプレイヤーキャラクターの自然な表情や口の動きを素早く生成します。
- アニメーション制作音声に基づいて高品質な3Dアニメーションを生成することで、制作効率を向上させ、人件費を削減します。
- 人間とコンピュータの相互作用スマートアシスタントの表情や口の動きをリアルに生成し、より人間らしくする。
- オンライン教育アニメーションを通して標準的な発音動作を示すことで言語学習を支援し、学習効果を高めます。