project
Pixel3DMM - ミュンヘン大学がユニバーシティ・カレッジ・ロンドンなどと共同で開発した3D顔面再構築フレームワーク。
Pixel3DMMは、ミュンヘン工科大学、ユニバーシティ・カレッジ・ロンドン、およびSynthesiaが共同開発した、単一画像からの3D顔再構成フレームワークです。DINOモデルをベースに、このフレームワークは、単一のRGB画像から顔を正確に再構成するための特殊な予測ヘッドを導入しています。
Pixel3DMMとは何ですか?
Pixel3DMMは、ミュンヘン工科大学、ユニバーシティ・カレッジ・ロンドン、およびSynthesiaが共同開発した、単一画像からの3D顔面再構成フレームワークです。DINOモデルをベースとしたこのフレームワークは、専用の予測ヘッドを導入することで、単一のRGB画像から3D顔面の形状を正確に再構成します。Pixel3DMMは複数のベンチマークにおいて非常に優れた性能を発揮し、複雑な表情や姿勢の処理において既存の手法を大幅に凌駕します。Pixel3DMMは、多様な表情、視点、および民族を網羅する新しいベンチマークを導入し、この分野の研究における新たな評価基準を提供します。
Pixel3DMMの主な機能
- 高精度3D顔面再構築単一のRGB画像から、顔の形状、表情、姿勢を含む3D人間の顔の形状を正確に再構築します。
- 複雑な表情やジェスチャーを扱う複雑な表情や正面からではない顔画像の処理に優れており、高品質な3D顔モデルを効果的に再構築できます。
- アイデンティティと表現の分離目標は、ポーズをとった画像から中立的な顔の形状を復元することであり、これは顔の識別情報と表情情報を区別し、再構築できることを意味する。
Pixel3DMMの技術的原理
- 事前学習済みビジョン・トランスフォーマー入力画像から特徴を抽出するためのバックボーンネットワークとしてDINOv2を使用しました。DINOv2は、豊富な意味的特徴を抽出できる強力な自己教師あり学習モデルであり、後続の幾何学的特徴予測のための確固たる基盤を提供します。
- 予測ヘッドDINOv2のバックボーンネットワークをベースに、追加のトランスフォーマーブロックと上位畳み込み層を追加することで、特徴マップの解像度を所望のサイズまで高め、最終的に予測された幾何学的特徴を出力します。表面法線やUV座標などのこれらの幾何学的特徴は、3D顔モデルを最適化するための重要な制約情報となります。
- FLAMEモデル適合本研究では、予測された表面法線とUV座標に基づいて3D顔を再構築するために、FLAMEモデルのパラメータを最適化します。FLAMEは、顔の同一性、表情、姿勢を表現できるパラメトリック3D顔モデルです。予測された幾何学的特徴とFLAMEモデルによるレンダリング結果との差を最小化することで、FLAMEモデルのパラメータを最適化し、高精度な3D顔再構築を実現します。
- 最適化戦略推論フェーズでは、予測された幾何学的特徴とFLAMEモデルのレンダリング結果との差を最小化することに基づいて、FLAMEモデルのパラメータが最適化されます。
- データ準備とトレーニング複数の高品質な3D顔データセット(NPHM、FaceScape、Ava256など)を用いて予測ネットワークを訓練し、非剛体位置合わせに基づいてそれらをFLAMEモデルのトポロジーに統合しました。これらのデータセットは、モデルの汎化能力を確保するために、様々な人物、表情、視点、照明条件を網羅しています。
Pixel3DMMプロジェクトのアドレス
- プロジェクト公式サイト:https://simongiebenhain.github.io/pixel3dmm/
- arXiv技術論文:https://arxiv.org/pdf/2505.00615
Pixel3DMMの応用シナリオ
- 映画とゲーム高品質な3D顔モデルを迅速に生成し、表情のキャプチャとアニメーション効果を向上させ、コストを削減できます。
- VR/ARリアルな仮想アバターを作成することで、没入感とインタラクションのリアリティを高めます。
- ソーシャルビデオ仮想背景や特殊効果を生成して視覚的な魅力を高め、より正確な顔表情認識とインタラクションを可能にします。
- 美容医療顔面手術の計画を支援し、仮想メイクや美容効果のプレビューを提供します。
- 学術研究これは、3D顔面再構築技術の開発を促進するための新しい手法と基準を提供するものです。