project
TaoAvatar - アリババのリアルタイム高精細3D全身対話型デジタルヒューマン技術
TaoAvatarは、アリババグループの研究チームが開発した、高忠実度かつ軽量な3D全身対話型仮想人間技術です。3Dガウススパッタリング技術に基づいており、高解像度レンダリングをサポートするフォトリアリスティックな3D全身仮想アバターを生成できます。
TaoAvatarとは何ですか?
TaoAvatarは、アリババグループの研究チームが開発した、高忠実度かつ軽量な3D全身対話型仮想人間技術です。3Dガウス型スパッタリング技術をベースとし、フォトリアリスティックな3D全身仮想アバターを生成し、低ストレージ容量で高解像度レンダリングをサポートします。TaoAvatarは、様々なモバイルデバイスやARデバイス上で90FPSの高フレームレートでリアルタイム動作し、音声、表情、ジェスチャー、姿勢といった複数の信号を通して、唇の動き、表情、ジェスチャー、姿勢の自然な同期を実現します。
TaoAvatarの主な機能
- 高精細な全身ダイナミック仮想アバター生成複数の視点からの画像シーケンスから、リアルでトポロジー的に一貫性のある全身3D仮想アバターを生成でき、姿勢、ジェスチャー、表情を細かく制御できます。
- リアルタイムレンダリングと低ストレージ要件様々なモバイルデバイスやARデバイス上で、90FPSという高いフレームレートでリアルタイム動作が可能で、高解像度レンダリングをサポートし、ストレージ容量の要件も低く抑えられています。
- マルチシグナル駆動音声、表情、ジェスチャー、姿勢など、さまざまな信号によって駆動され、唇の動き、表情、動作の自然な同期を実現できます。
- 軽量建築複雑な非剛体変形を軽量なMLPネットワークに「組み込み」、ハイブリッド形状補正の詳細を組み合わせることで、動作効率が大幅に向上する。
TaoAvatarの技術的原理
- 3Dガウス型スパッタリング(3DGS)技術3DGSは、シーン内の点を3Dガウス関数で表現し、それを2D画像平面に投影してレンダリングします。各3Dガウス関数は、位置、共分散、色、透明度などのパラメータによって記述されます。3D点群は、SfM(Structure from Motion)技術を用いてマルチビュー画像から推定され、各点は確率的勾配降下法を用いて学習されたガウス関数に変換されます。
- 姿勢依存型非剛体変形処理TaoAvatarは、複雑な非剛体変形を剛体変形と形状変形に分解します。次に、知識蒸留を用いて、形状変形を軽量なMLPネットワークに「焼き付け」ます。これにより、仮想アバターのリアリズムと制御性を維持しながら、複雑な姿勢依存の非剛体変形を効率的に処理することが可能になります。
- 学習可能なガウス混合形状仮想アバターの視覚的なディテールをさらに向上させるため、TaoAvatarは学習可能なガウス混合形状を導入しました。ニューラルネットワークを訓練して、さまざまなポーズや表情に対応するガウス混合形状のパラメータを学習させ、これらのパラメータを仮想アバターに適用します。これにより、仮想アバターはさまざまなポーズや表情において極めて高い忠実度を維持できます。
- リアルタイムレンダリングと最適化TaoAvatarは、GPUアクセラレーション、不要な計算の削減、モデル構造とパラメータの最適化など、さまざまな最適化技術を採用することで、高品質なリアルタイムレンダリングを実現しています。Apple Vision Proなどの高精細立体視ディスプレイデバイスでは、毎秒90フレームの滑らかな表示を維持します。
TaoAvatarのプロジェクトアドレス
- プロジェクト公式サイト:https://pixelai-team.github.io/TaoAvatar/
- arXiv技術論文:https://arxiv.org/pdf/2503.17032
TaoAvatarの応用事例
- eコマースのライブストリーミングユーザーエクスペリエンスを向上させ、人件費を削減するために、リアルな仮想アンカーを作成する。
- ホログラフィック通信遠隔通信において、リアルな仮想アバターを生成することで、没入感を高める。
- バーチャル会議参加者は、パーソナライズされた仮想アバターを使用してコミュニケーションを取ることができ、インタラクティブ性が向上します。
- オンライン教育オンラインコースにバーチャルヒューマンを活用することで、受講者の参加意欲と楽しさが向上する。
- バーチャルエンターテイメントゲームやバーチャルリアリティアプリケーションで、自分だけのオリジナルキャラクターを作成する。