AB
AiBoss
project

Make-A-Character:アリババのオープンソースAI 3Dデジタル人間生成フレームワーク

Make-A-Character(略称:Mach)は、アリババグループのインテリジェントコンピューティング研究所が開発した、AIを活用した3Dデジタル人間生成フレームワークです。テキスト記述に基づいて、リアルな3Dキャラクターを迅速に作成することを目的としています。このシステムは特に…

キャラクター作成とは何ですか?

Make-A-Character(略称:Mach)は、アリババグループのインテリジェントコンピューティング研究所が開発した、AIを活用した3Dデジタル人間生成フレームワークです。テキスト記述からリアルな3Dキャラクターを迅速に生成することを目的としています。このシステムは、AIエージェントやメタバースにおける、パーソナライズされた表現力豊かな3Dキャラクターのニーズを満たすのに特に適しています。Machの中核機能は、大規模な言語モデルとビジュアルモデルを用いてテキスト内の意図を理解し、中間画像を生成することです。これらの画像は、人間の視覚認識と3D生成を対象とした一連のモジュールを通して、完全な3Dキャラクターモデルに変換されます。

キャラクター作成公式サイトへの入り口

キャラクター作成機能の特徴

  • テキストから3Dキャラクターを生成するユーザーは、顔の特徴、髪型、服装など、キャラクターの外見に関する特徴をテキストで記述することで指定できます。Machシステムは、これらの記述に基づいて対応する3Dキャラクターモデルを生成します。
  • 柔軟でカスタマイズ可能このシステムでは、顔の特徴、目の形、虹彩の色、髪型と髪の色、眉毛、口、鼻など、キャラクターを詳細にカスタマイズできるだけでなく、しわやそばかすを追加して、ユーザー個々のニーズに合ったキャラクターを作成することもできます。
  • 非常にリアルな描写Machは、物理ベースレンダリング(PBR)技術と実際の人体スキャンデータを組み合わせることで、非常にリアルなキャラクターを生成します。キャラクターの髪は、従来のメッシュではなく、一本一本の毛束として構築されており、リアリティを高めています。
  • 完全なキャラクターモデル生成されたキャラクターモデルには、目、舌、歯、全身、衣服など、あらゆる詳細が含まれており、様々なアプリケーションシナリオでキャラクターをすぐに使用できることが保証されます。
  • アニメーションのサポートこのキャラクターは、標準的なアニメーションをサポートする高度な骨格構造を備えており、顔の表情の変化など、さまざまな動的な表現を行うことができます。
  • 業界互換性Machで生成されたキャラクターモデルは、ゲームや映画業界の標準的なCGワークフローにシームレスに統合できる明確な3D表現を使用しており、その後のアニメーション制作やレンダリングを容易にします。

キャラクター作成の仕組み

  1. テキスト解析と視覚的キュー生成
    • ユーザーは、キャラクターの特徴を説明するテキストプロンプトを入力します。
    • 大規模言語モデル(LLM)は、テキスト内の意味情報を理解し、顔の主要な特徴や属性を抽出するために使用されます。
    • これらの特徴は、姿勢マップやエッジマップなどの視覚的な手がかりにマッピングされ、その後の画像生成をガイドするために使用されます。
  2. 参照ポートレート画像の生成
    • 安定拡散モデルとControlNetを組み合わせることで、抽出された視覚的特徴に基づいて参照ポートレート画像が生成されます。ControlNetは、生成された画像が正面向きの姿勢と中立的な表情を持つことを保証し、その後の3Dモデリングを容易にします。
    • 顔の特徴が適切に分布するように、OpenPoseとCannyエッジ検出技術が使用されています。
  3. 高密度顔面座標検出
    • 顔と頭部の形状は、高密度の顔面座標(431個の座標点)を用いて再構築されます。これは、従来の68個または98個の座標点よりも詳細で、頭部全体をカバーします。
    • これらの座標点は、合成画像をトレーニングデータとして使用し、マルチビューキャプチャおよび処理プロセスを通じて生成されます。
  4. 幾何生成
    • 頭部の形状は、参照となる肖像画像と高密度な顔面座標に基づいて再構築されます。メッシュの最適化は、3Dメッシュを2D平面にマッピングすることによって実現されます。
    • 座標投影損失と局所平滑化制約は、形状の精度を確保するために使用されます。
  5. テクスチャ生成
    • 微分可能なレンダリング技術を用いて参照画像からテクスチャを抽出し、マルチ解像度戦略を用いて高解像度テクスチャを段階的に生成する。
    • テクスチャ画像から不要な照明効果を除去するために、ニューラルネットワークを用いた照明除去手法を導入し、レンダリングに適した拡散マップを生成する。
  6. テクスチャ補正と仕上げ
    • 生成された拡散マップは、目、口、鼻孔などの領域の不完全さを解消するために補正されます。
    • 顔分析アルゴリズムを用いてエラー領域のマスクを抽出し、ポアソンブレンド技術を用いてテンプレート拡散マップと合成することで、視覚効果を向上させる。
  7. 毛髪の成長
    • 2D画像から様々なヘアスタイルを合成し、それらの画像に基づいて3Dの毛髪を再構築する。
    • NeuralHDHairなどの高度な毛髪生成技術を用いてモデルを訓練し、高品質な3D毛髪を生成します。
  8. 資産マッチング
    • 生成された頭部は、髪型、体型、衣服、アクセサリーなどの既成のアセットと組み合わされます。
    • CLIPテキストエンコーダーは、入力プロンプトとアセットタグ間の類似性を計算するために使用され、最も一致するアセットが選択されます。
  9. キャラクターアセンブリ
    • 生成され、マッチングされたすべてのパーツを組み立てて、完全な3Dキャラクターモデルを作成します。
    • キャラクターモデルはアニメーションに対応しており、剛体を通して動的に表現できる。