LATTE3D - NVIDIAが提供する、テキストから3Dオブジェクトを素早く生成するためのモデル。
LATTE3Dは、NVIDIAの研究者によって開発されたテキストから3Dオブジェクトを生成するモデルです。テキストプロンプトから高品質の3Dコンテンツを高速に生成できます(わずか400ミリ秒)。この技術の中核は、「...」と呼ばれる手法にあります。
LATTE3Dとは何ですか?
LATTE3Dは、NVIDIAのトロントAIラボの研究者によって開発された、テキストから3Dオブジェクトを生成するモデルです。テキストプロンプトから高品質な3Dコンテンツをわずか400ミリ秒で高速に生成できます。この技術の中核は、「償却最適化」と呼ばれる手法にあります。これは、多数のテキストプロンプトにわたって共通のテキスト条件モデルを同時に最適化するものです。これにより、新しいプロンプトに対するモデルの汎化能力が向上し、各3Dオブジェクトの生成に必要な時間が短縮されます。
LATTE3D公式サイトへの入り口
- 公式プロジェクトホームページ:https://research.nvidia.com/labs/toronto-ai/LATTE3D/
- 研究論文:https://drive.google.com/file/d/1HZ7EY1jFguiwxxetgQkpljrj0cxbhZXZ/view
LATTE3Dの主な機能
- テキストから3Dへの合成: テキストによる説明に基づいて、対応する3Dモデルを生成できます。ユーザーは、「シルクハットをかぶったぬいぐるみのアメーバガニ」といったテキストを入力することで、特定の機能やスタイルの3Dオブジェクトを生成できます。
- 迅速な生成: LATTE3Dは約400ミリ秒で3Dオブジェクトを生成できるため、ユーザーの入力にリアルタイムで反応し、ユーザーに即座に視覚的なフィードバックを提供することができます。
- 高品質レンダリング: LATTE3Dは、ニューラルフィールドとテクスチャ付き表面生成を組み合わせることで、高精細なテクスチャ付きメッシュを生成し、視覚的に説得力のある3Dレンダリング結果を実現します。
- 3Dスタイル化: LATTE3Dは3Dスタイル化ツールとしても使用でき、ユーザーは既存の3Dアセットに新しいスタイルやテーマを適用することで、多様な視覚表現を生み出すことができます。
LATTE3Dの建築的アプローチ
LATTE3Dのトレーニングは2つのフェーズで構成されます。まず、ボリュームレンダリングを使用してテクスチャとジオメトリをトレーニングします。キューの堅牢性を高めるため、トレーニング目標には、3D対応画像事前情報からのSDS勾配と、予測形状のマスクをライブラリ内の3Dアセットと比較する正則化損失が含まれます。次に、サーフェスベースレンダリングを使用してテクスチャのみをトレーニングし、品質を向上させます。どちらのフェーズでも、一連のキューに対して償却最適化を使用して、高速な生成を維持します。
LATTE3Dの手法では、テクスチャネットワークTとジオメトリネットワークGという2つのネットワークを使用します。どちらのネットワークも、三平面とU-Netの組み合わせで構成されています。最初の段階では、両ネットワークのエンコーダーは同じ重みセットを共有します。2番目の段階では、ジオメトリネットワークGが固定され、テクスチャネットワークTが更新されます。さらに、入力テキストを埋め込むMLPを使用して、三平面がアップサンプリングされます。