AB
AiBoss
project

LHM - Alibaba Tongyiが提供するオープンソースツールで、1枚の画像からアニメーション付きの3D人体モデルを生成します。

LHM(Large Animatable Human Reconstruction Model)は、アリババ傘下のTongyi Labsが開発した製品で、1枚の画像からアニメーション付きの3D人体モデルを再構築します。マルチモーダルなTransformerアーキテクチャに基づいており、3Dジオメトリを統合し、...

LHMとは何ですか?

LHM(Large Animatable Human Reconstruction Model)は、アリババ傘下のTongyi Labsが開発したツールで、1枚の画像からアニメーション可能な3D人体モデルを再構築します。マルチモーダルなTransformerアーキテクチャに基づき、3D幾何学的特徴と2D画像特徴を統合し、アテンションメカニズムを用いて衣服の形状や質感の詳細を保持し、頭部特徴ピラミッド符号化方式を導入することで顔のディテール復元能力を向上させています。LHMは再構築された3Dモデルを3Dガウス点群の形で表現し、リアルタイムレンダリングとポーズ制御アニメーションをサポートします。このモデルは、AR/VRなどの没入型アプリケーションに適した、高品質でアニメーション可能な3D人体モデルを数秒で生成できます。

LHMの主な機能

  • 迅速な再建複雑な後処理を必要とせず、1枚の画像を数秒で3Dアニメーションモデルに変換できます。
  • 高精細なディテール衣服の質感や顔のディテールといった重要な情報を正確に保持することで、高品質な3Dモデルを生成します。
  • リアルタイムアニメーション姿勢制御に基づくリアルタイムアニメーションレンダリングをサポートしており、没入型アプリケーション(AR/VRなど)に適しています。
  • 高い一般化能力実写撮影において非常に優れた性能を発揮し、様々な状況やポーズに対応します。

LHMの技術原則

  • マルチモーダルトランスフォーマーアーキテクチャTransformerアーキテクチャに基づき、3D幾何学的特徴(SMPL-Xテンプレートからサンプリングされた表面点)と2D画像特徴(事前学習済みのビジュアルTransformerから抽出)を融合することで、幾何学的情報と視覚情報を効率的に処理します。頭部領域向けに設計されたマルチスケール特徴抽出スキームは、異なるレベルの特徴を集約することで、顔の細部を復元する能力を高めます。
  • 3Dガウス点群表現この技術は、3Dガウス点群表現を用いて3Dモデルを表現し、リアルタイムかつ高品質なレンダリングをサポートします。ネットワークはガウス点群のパラメータ(位置、回転、拡大縮小、色など)を直接予測するため、入力画像から3Dモデルへの高速変換が可能になります。
  • 自己指導型学習このモデルは、大規模なビデオデータに基づいて学習され、レンダリング損失と正則化項を用いて最適化されており、限られた3Dスキャンデータに頼ることはありません。学習中は、3Dモデルの幾何学的妥当性を維持するために、「できるだけ近い」および「できるだけ球形に近い」という正則化項が導入されます。
  • リアルタイムアニメーション対応SMPL-Xの骨格パラメータに基づいて再構築された3Dモデルは、目標姿勢に変形され、リアルタイムの姿勢制御アニメーションをサポートします。再構築とアニメーションの全プロセスは単一の順伝播で完了するため、リアルタイムアプリケーションに適しています。

LHMのプロジェクト住所

LHMの応用シナリオ

  • 仮想現実(VR)と拡張現実(AR)写真を素早くアニメーション化された3D仮想キャラクターに変換し、没入感とインタラクティブ性を向上させます。
  • ゲーム開発高品質な3Dキャラクターモデルを迅速に生成し、リアルタイムアニメーションをサポートすることで、開発効率とゲーム体験を向上させることができます。
  • 映画およびテレビ制作特殊効果制作やアニメーション映画で使用され、キャラクターモデルを迅速に生成することで、制作効率と品質を向上させます。
  • ソーシャルメディアとコンテンツ制作ユーザーはソーシャルメディア用の3D仮想アバターを作成でき、クリエイターはショートビデオなどに使用する3Dキャラクターを素早く作成できる。
  • 教育と訓練オンライン教育用の仮想教師や教育補助員を作成したり、医学や軍事などの分野におけるシミュレーション訓練用の3Dモデルを生成したりする。