AB
AiBoss
project

Dive3D - 北京大学と小紅書が共同開発した、テキストから3Dを生成するフレームワーク。

Dive3Dは、北京大学と小紅書(小紅書)の共同開発によるテキストから3Dへの生成フレームワークです。このフレームワークは、従来のKLダイバージェンス目的関数の代わりにスコア暗黙的マッチング(SIM)損失関数を使用することで、パターン崩壊を効果的に回避しています。

Dive3Dとは何ですか?

Dive3Dは、北京大学と小紅書が共同開発したテキストから3Dを生成するフレームワークです。このフレームワークは、従来のKLダイバージェンス目的関数をスコア暗黙的マッチング(SIM)損失に置き換えることで、パターン崩壊を効果的に回避し、生成される3Dコンテンツの多様性を大幅に向上させています。Dive3Dは、テキストの整列性、人間の好み、視覚的な忠実度において優れており、GPTEval3Dベンチマークで優れた定量的結果を達成し、高品質で多様な3Dアセットを生成する強力な能力を実証しています。

Dive3Dの主な機能

  • 多様な3Dコンテンツ生成テキストプロンプトに基づいて、さまざまなスタイルと詳細を備えた3Dモデルを生成することで、従来の手法でよく見られるパターン崩壊問題、つまり生成される結果が単調で似通ってしまう問題を回避します。
  • 高品質な3Dモデル生成高い視覚的忠実度を備えた3Dモデルの生成をサポートしており、きめ細かなテクスチャ、リアルな形状、適切な照明効果などが含まれます。
  • 優れたテキスト配置機能入力されたテキスト記述に忠実に一致する3Dモデルを生成する機能をサポートしており、テキスト中で言及されている様々な要素や特徴を正確に反映します。
  • 複数の3D表現形式に対応さまざまなアプリケーションシナリオやユーザーのニーズを満たすために、ニューラル放射場(NeRF)、ガウススプラッティング、メッシュなど、さまざまな種類の3D表現の生成をサポートしています。

Dive3Dの技術的原理

  • スコア暗黙的マッチング(SIM)損失Dive3Dの中核技術の一つは、KLダイバージェンスに基づく損失関数(スコア蒸留サンプリング(SDS)などで使用されているもの)です。従来のKLダイバージェンスに基づく損失関数(スコア蒸留サンプリング(SDS)などで使用されているもの)は、パターン探索行動につながり、生成モデルが高密度領域からサンプルを生成する傾向があり、生成の多様性が制限されます。SIM損失は、生成されたコンテンツの確率密度勾配場(スコア)を拡散事前分布のスコアと直接一致させることで、KLダイバージェンスの問題を回避し、モデルが複数の高確率領域を探索するように促し、忠実度を維持しながら生成の多様性を向上させます。
  • 統一的乖離視点フレームワークDive3Dは、拡散蒸留と報酬誘導型最適化をダイバージェンスベースのフレームワークに統合しています。このフレームワークは、条件付き拡散事前損失(CDP)、無条件拡散事前損失(UDP)、および報酬損失(ER)という3つの主要なダイバージェンス損失で構成されています。これらの損失を適切に組み合わせ、重みを調整することで、生成される多様性、テキストの整列、および視覚的な品質のバランスが実現されます。
  • 拡散モデルに基づく最適化Dive3Dは、事前学習済みの2D拡散モデル(Stable Diffusionなど)を事前知識として使用し、マルチビューレンダリングに基づいて、テキストプロンプトに一致する2D画像に3D表現を最適化します。最適化プロセスでは、3Dモデルが繰り返しレンダリングされ、損失が計算され、モデルパラメータが更新されるため、生成された3Dモデルのレンダリング画像は、事前学習済みの拡散モデルによって期待される画像分布に徐々に近づきます。
  • 高効率な最適化アルゴリズム最適化効率を向上させるため、Dive3Dは効率的な最適化アルゴリズムと戦略を採用しています。例えば、分類器フリーガイダンス(CFG)技術を導入することで、最適化プロセスにおけるテキスト条件付き手法と無条件手法の生成効果のバランスを改善しています。また、ノイズスケジュールや最適化ステップサイズなどのパラメータを適切に設定することで、最適化の収束速度を速め、生成時間を短縮しています。

Dive3Dプロジェクトのアドレス

  • プロジェクト公式サイト:https://ai4scientificimaging.org/dive3d/
  • GitHubリポジトリ:https://github.com/ai4imaging/dive3d
  • arXiv技術論文:https://arxiv.org/pdf/2506.13594

Dive3Dの応用シナリオ

  • ゲーム開発ゲームキャラクター、アイテム、シーンを素早く生成します。ゲームスクリプトの記述に基づいて、様々なスタイルとディテールを持つゲームキャラクターモデルを自動生成し、アートデザインの作業負担を軽減します。
  • 映画およびテレビ制作映画、テレビ、アニメーション制作向けに、クリエイティブなプロトタイプやコンセプトデザインを提供します。脚本の説明に基づいてシーンやキャラクターの3Dモデルを生成し、監督や美術監督が創造的なアイデアをより効果的に発展させるのを支援します。
  • 建築設計テキストによる説明に基づいて建築モデルを生成することで、建築家が設計コンセプトを迅速に提示し、さまざまな選択肢を比較・最適化するのに役立ちます。
  • 仮想シーンの構築VRおよびARアプリケーション向けに、リアルな仮想シーンとオブジェクトを生成します。仮想観光アプリケーションでは、ユーザーが入力した場所の説明に基づいて対応する3Dシーンを生成し、ユーザーがまるでその場にいるかのように仮想環境を体験できるようにします。
  • 科学教育生物細胞や分子構造といった複雑な科学モデルを作成し、学生が抽象的な科学概念をより深く理解できるようにする。