project
Follow-Your-Emoji - Tencentなどが開発した、拡散モデルに基づいたポートレートアニメーションフレームワーク。
Follow-Your-Emojiは、香港科技大学、テンセント渾源、清華大学の研究者らが開発した、拡散モデルに基づくポートレートアニメーションフレームワークです。拡散モデルを用いて、参照ポートレートにターゲット表情シーケンスを追加することで、アニメーションを実現します。
Follow-YourEmojiとは何ですか?
Follow-Your-Emojiは、香港科技大学、テンセント渾源、清華大学の研究者らが開発した、拡散モデルに基づくポートレートアニメーションフレームワークです。拡散モデルを用いて、参照ポートレートにターゲットとなる表情シーケンスを追加することで、ダイナミックなアニメーション効果を実現します。この技術は、表情認識マーカーを用いて表情をポートレートに正確に位置合わせし、個人情報の漏洩を防ぐとともに、顔の精緻化損失関数を用いて、微妙な顔の変化を捉えるモデルの能力を高めています。Follow-Your-Emojiは、実写、漫画、彫刻、さらには動物アニメーションなど、様々なスタイルのポートレートアニメーションに対応しており、高い制御性と表現力を発揮します。
Follow-YourEmojiの機能
- 同期されたアニメーション絵文字Follow-Your-Emojiは、拡散モデル技術を用いることで、事前に定義された絵文字シーケンスやリアルタイムでキャプチャした絵文字シーケンスを静止画の参照ポートレートに正確に同期させることができ、まばたき、笑顔、しかめっ面といった複雑な表情の動的な変化を可能にします。
- アイデンティティ特性の保存アニメーション処理中、フレームワークは、参照ポートレートの主要な特徴が確実に保持され、表情が大きく変化した場合でも、身元情報の歪みや漏洩を防ぐための特別なメカニズムを設計しています。
- 大げさな表情顔表情認識マーカー技術により、フレームは漫画やコミックによく見られるような、瞳孔の大きな拡張や収縮といった誇張された表情を捉えて再現することができ、アニメーションの表現力を高める。
- マルチスタイル適応Follow-YourEmojiフレームは、写実的な肖像画に限定されるものではありません。漫画、彫刻、動物など、さまざまな芸術スタイルや表現形式の肖像画にも対応し、アニメーション化できるため、その幅広い応用性を示しています。
- 時間的コヒーレンスこのフレームワークは、顔の精緻化損失関数を用いることで、アニメーションの各フレームを生成する際に、前後のフレームとの連続性を考慮し、アニメーションシーケンス全体を通して自然な移行とスムーズな動作を保証します。
- 長期アニメーション生成Follow-Your-Emojiは、段階的な生成戦略を用いることで、短期的に一貫性のあるアニメーションを生成するだけでなく、長期再生においても安定性と高品質を維持することができます。
- 高度な制御ユーザーは顔の表情のシーケンスを正確に制御できるため、アニメーションの出力を精密に調整でき、特定のニーズに応じてアニメーション効果をカスタマイズすることが可能になり、パーソナライズされた作品制作を実現できます。
Follow-YourEmojiの公式ウェブサイトのエントリー
- 公式プロジェクトホームページ:https://follow-your-emoji.github.io/
- arXivの技術論文:https://arxiv.org/abs/2406.01900
Follow-YourEmojiの背後にある技術原理
- 拡散モデルに基づくフレームワークこのシステムは、高品質な画像や動画コンテンツを生成できる高度な深層学習モデルである安定拡散モデルを基盤としています。
- 表情認識型ランドマークMediaPipeなどのツールは、動的な動画から3Dキーポイントを抽出するために使用され、抽出されたキーポイントは2D平面に投影されて、アニメーション処理をガイドする表情認識マーカーが作成されます。これらのマーカーは、目(瞳孔点)や口など、表情の変化が顕著な主要な領域に特化して焦点を当て、より正確な表情同期を実現します。
- 顔面微細損失関数本研究では、顔マスキングと表情マスキングを用いて、学習中にモデルが顔の表情の細部にさらに注意を払うように導くための新しい損失関数を導入する。この損失関数は、マスクされた領域内の予測結果と実際の結果の差を計算することで、モデルが表情の微妙な変化をより適切に捉える方法を学習するのに役立つ。
- 多様なスタイルへの適応性このフレームは、実在の人物、漫画、彫刻、動物など、さまざまなスタイルの肖像画に対応できるように設計されており、自然なアニメーション効果を実現できます。
- 漸進的世代戦略長時間のアニメーションを生成するために、粗いフレームから細かいフレームへと段階的に生成していく手法を採用しています。まずキーフレームを生成し、次に補間によって中間フレームを生成することで、アニメーションの連続性と安定性を維持します。
- 時間注意機構アニメーションフレーム間の時間的な一貫性と動的な整合性を維持するために、UNetネットワークに時間的注意層を追加します。
- 事前学習と微調整このモデルは、表現力豊かなトレーニングデータの大規模なデータセットを使用して事前学習され、その後、特定のアニメーションタスクに合わせて微調整されることで、表現力と精度が向上します。
- データセットとベンチマークの構築チームは、モデルの性能を評価・検証するために、さまざまなスタイルや表情のポートレート動画を含むEmojiBenchベンチマークを構築した。
- 推論とアニメーション生成推論段階では、モデルは顔の表情認識マーカーと時間的注意メカニズムを組み合わせて、参照ポートレートのアイデンティティ特徴を維持しながら、動的なポートレートアニメーションを生成します。
- ユーザーによる制御とカスタマイズユーザーは、異なる絵文字シーケンスを入力することでアニメーションの出力を制御し、高度にカスタマイズされたアニメーション効果を実現できます。