project
DiffSplat - 北京大学とByteDanceが共同開発した3D生成フレームワーク。
DiffSplatは、テキストプロンプトと単一ビュー画像から3Dガウススプラットを高速に生成する新しい3D生成手法です。強力な2D事前分布に基づく事前学習済みのテキストから画像への拡散モデルを活用しています。
DiffSplatとは何ですか?
DiffSplatは、テキストプロンプトと単一ビュー画像から3Dガウススプラットを高速に生成する斬新な3D生成手法です。事前学習済みのテキストから画像への拡散モデルを微調整することで、強力な2D事前知識を活用し、3Dレンダリング損失を導入することで、複数のビュー間で生成される3Dコンテンツの一貫性を確保します。DiffSplatの最大の特長は、効率性と柔軟性にあり、1~2秒以内に高品質の3Dオブジェクトを生成し、テキストベース、画像ベース、またはそれらを組み合わせた入力に対応します。軽量な再構成モデルを使用して構造化されたガウス表現を構築し、トレーニング用の高品質データを提供します。
DiffSplatの主な機能
- テキストまたは画像から3Dガウスラスターを生成するDiffSplatは、テキストプロンプトまたは単一ビュー画像から直接3Dガウススプラットを生成し、3Dの一貫性を維持します。
- 2次元の事前知識を効率的に活用するDiffSplatは、大規模なテキストから画像への拡散モデルを微調整することで、ネットワーク規模の2D事前知識を効果的に活用しつつ、3Dレンダリング損失を導入することで、あらゆる視点において生成コンテンツの3D一貫性を確保します。
- 複数の入力条件をサポートDiffSplatは、テキスト条件、画像条件、またはその両方の組み合わせの入力をサポートしており、ユーザーは必要に応じて適切な条件を選択できます。
- 制御可能な発電能力DiffSplatは、ControlNetなどの技術と組み合わせることで、テキストプロンプトや様々なフォーマット(法線マップ、深度マップ、Cannyエッジマップなど)に基づいて、制御可能な3D生成を実現できます。
DiffSplatの技術原理
- 大規模な事前学習済みテキストから画像への拡散モデルに基づくDiffSplatは、これらのモデルを微調整することで3Dガウススプラットを直接生成し、ネットワーク規模で2Dの事前知識を効果的に活用します。
- 軽量再建モデルトレーニングを可能にするため、DiffSplatは、スケーラブルなデータセット構築のために、マルチビューガウスグリッドを迅速に生成できる軽量な再構成モデルを提案している。
- 3Dレンダリングの損失DiffSplatは、生成される3Dコンテンツがどの視点においても一貫性を保つように、3Dレンダリングの損失を導入します。
DiffSplatのプロジェクトアドレス
- プロジェクト公式サイト:https://chenguolin.github.io/projects/DiffSplat/
- GitHubリポジトリ:https://github.com/chenguolin/DiffSplat
- arXiv技術論文:https://arxiv.org/pdf/2501.16764
DiffSplatの応用シナリオ
- 3Dコンテンツ制作迅速なプロトタイピングとコンテンツ制作に適しています。デザイナーはDiffSplatを使用して、コンセプトの検証やさらなる微調整のための3Dモデルの初期バージョンを迅速に生成できます。
- テキストから3Dを生成するDiffSplatは、テキストベースの3D生成タスクに優れており、詳細なテキスト記述に基づいて一致する3Dモデルを生成します。
- 画像から3Dへの再構成DiffSplatは、単一画像から3Dモデルを生成する機能をサポートしており、入力画像の形状と質感を正確に反映します。既存の画像リソースから3Dモデルを迅速に生成できるため、映画やテレビの特殊効果、ゲーム開発などの分野で役立ちます。
- 下流アプリケーションのサポートDiffSplatによって生成された結果は、3Dプリンティング、仮想現実(VR)、拡張現実(AR)など、さまざまな下流アプリケーションで直接使用できます。