project
ワンショット・ワントーク ― 中国科学技術大学と香港理工大学が共同開発した、動的な画像生成技術。
One Shot, One Talkは、1枚の画像からパーソナライズされた詳細情報を備えた、完全にアニメーション化された会話アバターを生成できる高度な画像生成技術です。自然な表情や生き生きとした体の動きなど、リアルなアニメーション効果をサポートします。
「ワンショット・ワントーク」とは何ですか?
One Shot, One Talkは、1枚の画像からパーソナライズされた詳細情報を備えた、完全にアニメーション化された会話アバターを生成できる高度な画像生成技術です。自然な表情や生き生きとした体の動きなど、リアルなアニメーション効果をサポートしています。中国科学技術大学と香港理工大学の研究者によって開発されたOne Shot, One Talkは、ポーズ誘導型画像からビデオへの拡散モデルと3DGSメッシュハイブリッドアバター表現を組み合わせることで、新しいポーズや表情にも一般化でき、1枚の画像からリアルで正確にアニメーション化された、表現力豊かな全身会話アバターを生成します。
『ワンショット、ワントーク』の主な特徴
- 単一画像再構成一枚の画像から、全身が動き、話すアバターを再構築する。
- リアルなアニメーション体の動きや表情など、リアルなアニメーション効果をサポートします。
- パーソナライズされた詳細個人の特性や詳細を捉え、再現すること。
- 精密制御アバターのポーズや表情を精密に制御できます。
- 一般化能力それは、訓練中に見られなかったような新しい姿勢や表情にも応用できる可能性がある。
ワンショット・ワントークの技術的原理
- 姿勢誘導型画像から動画への拡散モデルこのモデルは、不完全なビデオフレームを擬似ラベルとして生成し、新しいポーズや表情に一般化できるようにする。
- 3DGSメッシュハイブリッドアバター表現3Dガウスモデル(3DGS)とパラメトリックメッシュモデル(SMPL-Xなど)を組み合わせることで、アバターの表現力とリアリティが向上します。
- 主要な正則化手法擬似タグによって引き起こされる矛盾を軽減するために正規化手法が適用され、アバター構造と動的モデリングの正確性が確保されます。
- 擬似タグ生成TEDジェスチャーデータセットなどのデータセットを用いて事前学習済みモデルを駆動することで、対象人物が様々なポーズや表情をとっている動画シーケンスを生成することができる。
- 損失関数と制約条件この設計では、入力画像と擬似ラベルから情報を効果的に抽出し、頭部再構成プロセスを安定させるために、知覚損失(LPIPSなど)やピクセルレベルの損失を含む複数の損失関数と制約を組み込んでいます。
- 最適化とトレーニング学習にはAdamオプティマイザが使用され、最適な頭部再構成効果を実現するために、慎重に設計された損失重みに基づいてさまざまな損失関数がバランス調整されます。
ワンショット、ワントークプロジェクトの住所
- プロジェクト公式サイト:xiangjun-xj.github.io/OneShotOneTalk
- arXiv技術論文:https://arxiv.org/pdf/2412.01106
One Sho, One Talkの応用事例
- 拡張現実(AR)と仮想現実(VR)AR/VRアプリケーションにおいて、リアルな仮想キャラクターを作成することで、ユーザーの没入感とインタラクティブな体験が向上する。
- 遠隔会議と遠隔プレゼンテーションリアルな全身動体アバターを生成する技術に基づいており、遠隔会議において、より自然で効率的な遠隔コミュニケーションを実現するために活用できる。
- ゲームとエンターテイメントゲームや映画制作において、キャラクターの迅速な生成やカスタマイズを可能にし、従来のモーションキャプチャやモデリングにかかる時間とコストを削減します。
- ソーシャルメディアとコンテンツ制作ユーザーは、ソーシャルメディアプラットフォームで使用するため、またはコンテンツ作成のための仮想アンカーとして使用するために、パーソナライズされた仮想アバターを作成します。
- 教育と訓練仮想教育環境では、教師はリアルな仮想アバターを使用するため、遠隔教育の効果を高めることができる。