project
Sonic - テンセントと浙江大学が共同開発した、音声駆動型ポートレートアニメーションフレームワーク
Sonicは、Tencentと浙江大学が共同開発した音声駆動型ポートレートアニメーションフレームワークです。グローバルな音声知覚に基づいて、リアルな表情と動きを生成します。Sonicは、コンテキスト強化型音声学習とモーション分離コントローラを利用して音声を抽出します。
ソニックとは何ですか?
Sonicは、Tencentと浙江大学が共同開発した音声駆動型ポートレートアニメーションフレームワークです。グローバルな音声認識に基づいて、リアルな表情と動きを生成します。Sonicは、コンテキスト強化型音声学習とモーション分離コントローラを活用し、音声セグメント内の長期的な時間的音声知識を抽出し、頭部と表情の動きを独立して制御することで、ローカルな音声認識能力を向上させています。また、時間認識型位置オフセット融合メカニズムを採用することで、ローカルな音声認識をグローバルレベルに拡張し、長時間の動画生成におけるジッターや急激な変化を解消します。Sonicは、動画品質、リップシンク精度、モーションの多様性、時間的一貫性において、既存の最先端手法を凌駕し、ポートレートアニメーションの自然さと一貫性を大幅に向上させ、ユーザーによる微調整にも対応しています。
ソニックの主な機能
- リアルなリップシンク音声と唇の動きを正確に同期させることで、発話内容が口の形と高い整合性を保つようにします。
- 豊かな表情と頭の動き多様で自然な表情や頭の動きを生成することで、アニメーションをより生き生きと表現豊かにします。
- 長期安定発電長時間の動画を処理する際、安定した出力を維持し、ジッターや急激な変化を回避し、全体的な一貫性を確保できます。
- ユーザーによる調整が可能この機能により、ユーザーはパラメーターに基づいて頭の動き、表情の強さ、リップシンク効果を調整・制御することができ、高度なカスタマイズが可能になります。
ソニックの技術原理
- 文脈強化型音声学習このアプローチでは、音声セグメントから長期的な音声知識を抽出し、音声信号に含まれるイントネーションや話速などの情報を、顔の表情や唇の動きに関する事前知識に変換します。Whisper-Tinyモデルは音声特徴を抽出し、これらの特徴をマルチスケール理解に基づく空間的クロスアテンション層と組み合わせることで、空間フレームの生成を誘導します。
- モーションデカップリングコントローラこの機能は、頭部の動きと表情を分離し、それぞれ独立したパラメータで制御することで、アニメーションの多様性と自然さを向上させます。また、モーションバケットパラメータを調整することで、頭部と顔の動きの振幅を制御し、ユーザー定義の誇張された動きにも対応します。
- 時間認識型位置オフセット融合時間を考慮したスライディングウィンドウ戦略は、音声セグメントの認識を局所的なものから全体的なものへと拡張し、長時間の動画生成におけるジッターや急激な変化に対処します。各タイムステップにおいて、モデルは音声セグメントを新しい位置から処理し、全体的な音声情報を徐々に融合させることで、長時間の動画の連続性を確保します。
- グローバルオーディオドライバーSonicはアニメーション生成に音声信号のみを使用し、従来の手法に見られるような視覚信号(モーションフレームなど)への依存を排除することで、生成されるアニメーションの自然さと時間的な一貫性を向上させています。音声信号はグローバル信号として、顔の表情や頭の動きに関する暗黙的な事前情報を提供するため、生成されるアニメーションは音声コンテンツとより整合性の取れたものになります。
ソニックの実験結果
- 定量的比較:
- HDTFおよびCelebV-HQデータセットにおいて、SonicはFID(フレシェ開始距離)、FVD(フレシェビデオ距離)、リップシンク精度(Sync-C、Sync-D)、ビデオの滑らかさなど、複数の評価指標で既存の最先端手法を上回る性能を発揮します。
- SonicのFIDおよびFVDスコアは他の手法よりも著しく低く、これはSonicが実際のデータとの整合性が高く、より高品質な動画を生成していることを示しています。
- 定性的な比較Sonicは、より自然で多様な表情や頭の動きを生成でき、複雑な背景や様々なスタイルの肖像画を扱う際に特に優れた性能を発揮します。
ソニックの世代効果
-
オープンソース手法との比較Sonicは、音声によりマッチした、より豊かな表情を生成し、より自然な頭の動きを促すことができる。
-
クローズドソース方式との比較:
-
EMOと比較して
-
ソニックは、表情の自然さや眼鏡に映る像のリアルさという点で、より優れた性能を発揮している。
-
-
-
-
-
歌唱パフォーマンスにおいて、ソニックはより正確な発音とより幅広い動きを披露する。
-
-
-
-
即時の夢と比較:
-
アニメの例では、ソニックの口の動きや見た目は元の入力に近く、まばたきもする。
-
-
-
-
-
長時間の動画生成において、Sonicはモーションフレームに制限されないため、動画の最後に発生するアーティファクトを回避できます。
-
-
ソニックのプロジェクトアドレス
- プロジェクト公式サイト:https://jixiaozhong.github.io/Sonic/
- GitHubリポジトリ:https://github.com/jixiaozhong/Sonic
- arXiv技術論文:https://arxiv.org/pdf/2411.16331
- オンラインでデモを体験してください:http://demo.sonic.jixiaozhong.online/
ソニックの応用シナリオ
- バーチャルリアリティ(VR)仮想キャラクターのリアルな表情や口の動きを生成し、没入感を高めます。
- 映画およびテレビ制作キャラクターの口パクや表情アニメーションを素早く生成し、制作効率を向上させます。
- オンライン教育教師の声を生き生きとしたアニメーションに変えることで、学習の楽しさが増します。
- ゲーム開発ゲームキャラクターの自然な表情や動きを生成し、リアリティを高める。
- ソーシャルメディアユーザーは音声と写真を組み合わせて、自分だけのオリジナルアニメーション動画を作成し、共有することができます。