AB
AiBoss
project

Direct3D-S2 - 南京大学、復旦大学、その他の大学が共同開発した高解像度3D生成フレームワーク。

Direct3D-S2は、南京大学、DreamTech、復旦大学、オックスフォード大学の研究者らが共同開発した高解像度3D生成フレームワークです。疎なボリューム表現と革新的な空間疎アテンション(SSA)メカニズムに基づいています。

Direct3D-S2とは何ですか?

Direct3D-S2は、南京大学、DreamTech、復旦大学、オックスフォード大学の研究者らが共同開発した高解像度3D生成フレームワークです。疎な体積表現と革新的な空間疎アテンション(SSA)メカニズムに基づき、拡散変換(DiT)の計算効率を大幅に向上させ、学習コストを大幅に削減します。このフレームワークは、対称エンコーダー・デコーダー構造を用いた完全なエンドツーエンドの疎SDF変分オートエンコーダー(SS-VAE)を備え、マルチ解像度学習をサポートし、8つのGPUを使用して最大1024³の解像度で学習できます。Direct3D-S2は、生成品質と効率の両面で既存の手法を凌駕し、高解像度3Dコンテンツ制作のための強力な技術サポートを提供します。

Direct3D-S2の主な機能

  • 高解像度3D形状生成画像から高解像度の3D形状を生成し、最大1024³の解像度をサポートします。生成される3Dモデルは、精緻な幾何学的ディテールと高い視覚品質を備えています。
  • 効率的な訓練と推論拡散変換(DiT)の計算効率を大幅に向上させ、トレーニングコストを削減します。1024³解像度でのトレーニングに必要なGPUはわずか8個です。
  • 画像条件の3D生成画像ベースの条件付き生成をサポートしており、入力画像に基づいて対応する3Dモデルを生成します。

Direct3D-S2の技術原理

  • 空間スパース注意(SSA)メカニズム入力トークンは3D座標に基づいてブロックに分割されます。スパース3D畳み込みとプーリング演算を用いてブロックレベルのグローバル情報を抽出し、トークン数を削減して計算効率を向上させます。圧縮モジュールからのアテンションスコアに基づいて、重要なブロックを選択してきめ細かい特徴抽出を行い、計算リソースの利用をさらに最適化します。ローカルウィンドウ演算を用いてローカル特徴を挿入し、ローカル特徴間の相互作用を強化して生成品質を向上させます。3つのモジュールの出力は、予測されたゲーティングスコアに基づいて集約され、最終的なアテンション結果が生成されます。
  • スパースSDF変分オートエンコーダー(SS-VAE)この手法では、疎な3D畳み込みネットワークとTransformerネットワークを組み合わせて、高解像度の疎なSDFボリュームを疎な潜在表現にエンコードし、デコーダに基づいてSDFボリュームを再構築します。トレーニング中は、異なる解像度のSDFボリュームをランダムにサンプリングすることで、様々な解像度のデータに対するモデルの適応性を向上させ、トレーニング効率と汎化能力を高めます。
  • 画像調整拡散変換器(SS-DiT)入力画像から疎な前景トークンを抽出することで、背景トークンによる干渉が軽減され、生成された3Dモデルと入力画像との整合性が向上します。条件付きフローマッチング(CFM)トレーニングに基づき、モデルはノイズの多いサンプルからデータ分布への速度場を予測し、効率的な3D形状生成を実現します。

Direct3D-S2プロジェクトのアドレス

Direct3D-S2の応用シナリオ

  • 仮想現実(VR)と拡張現実(AR)教育や文化遺産の保存のために、リアルな3D環境を構築し、パーソナライズされた3Dキャラクターを作成し、現実世界のシナリオを統合します。
  • ゲーム開発高品質な3Dゲームアセットを迅速に生成し、リアルタイムの3Dコンテンツ生成を実現し、プレイヤーの入力に基づいてカスタマイズされたコンテンツを生成することができます。
  • 製品設計とプロトタイピング製品の3Dモデルを迅速に生成し、製品をバーチャルに展示し、個々のデザインニーズに対応します。
  • 映画およびアニメーション制作高品質な3Dアニメーションキャラクターを生成し、仮想シーンを作成し、複雑な3D特殊効果を制作します。
  • 教育と訓練仮想実験室を作成し、3D教育モデルを生成し、仮想職業訓練を実施する。