project
3DV-TON - アリババDAMOアカデミーが浙江大学などの機関と共同で開発した、ビデオによる仮想試着フレームワーク。
3DV-TON(Textured 3D-Guided Consistent Video Try-on via Diffusion Models)は、拡散モデルに基づいたビデオ仮想試着システムであり、Alibaba DAMO Academy、Lakeside Lab、浙江大学が共同開発しました。
3DV-TONとは何ですか?
3DV-TON(Textured 3D-Guided Consistent Video Try-on via Diffusion Models)は、拡散モデルに基づいたビデオ仮想試着フレームワークであり、Alibaba DAMO Academy、Lakeside Lab、および浙江大学が共同開発しました。複雑な衣服のパターンや多様な人間のポーズを扱う際に、既存の手法では生成結果が不十分になるという問題を解決します。このフレームワークは、生成されたアニメーション可能なテクスチャ付き3Dメッシュを明示的なフレームレベルのガイダンスとして使用することで、生成される試着ビデオの優れた視覚品質と時間的な一貫性を保証します。3DV-TONは高解像度ベンチマークデータセットHR-VVTを組み込んでおり、ビデオ試着技術の研究を推進します。
3DV-TONの主な機能
- 高精細な視覚効果衣服の細部まで正確に再現し、リアルな試着効果を生み出します。
- 時間的一貫性: アーティファクトや歪みを避けるため、動画内の衣服の質感が異なるフレーム間で一貫した動きを維持するようにしてください。
- 複雑なシナリオに適応する多様な衣服の種類、複雑な人間の姿勢、そして動的なシーンの処理に対応しています。
- ベンチマークデータセットを提供する関連分野の研究と評価を促進するため、高解像度ビデオ試着ベンチマークデータセットHR-VVTを紹介します。
3DV-TONの技術原理
- テクスチャ付き3Dガイダンス単一画像からの3D再構成技術により、アニメーション可能なテクスチャ付き3Dメッシュが生成されます。3Dメッシュを元の動画のポーズと同期させることで、拡散モデルに対する明確なフレームレベルのガイダンスが提供され、生成された試着結果の外観と動きの一貫性が確保されます。
- 動的3Dガイドパイプライン初期の2D画像試着のためにキーフレームを選択し、アニメーション化されたテクスチャ付き3Dメッシュを再構築します。SMPL-Xのパラメータを最適化して、3Dメッシュが人間のポーズに正確に一致するようにします。
- 長方形マスキング戦略衣服情報の漏洩を防ぎ、動的な人や衣服の動きによるアーティファクトを回避するために、この手法では衣服画像と試着画像を参照として組み合わせ、文脈情報を提供し、生成効果を高めます。
- 拡散モデルアーキテクチャ安定拡散に基づき、UNetアーキテクチャを拡張して擬似3D構造をサポートするようにしました。時間モジュールの統合により、リアルな動きの生成を実現し、明示的なオプティカルフローや変形演算への依存度を低減しています。
- トレーニング戦略このモデルは、画像データと動画データを組み合わせて学習され、ランダムに選択されたデータタイプに基づいて画質と時間的一貫性のバランスが取られています。分類器フリーガイド(CFG)戦略を採用することで、特定の条件付き入力をランダムに省略し、モデルの堅牢性を高めています。
3DV-TONプロジェクトの住所
- プロジェクト公式サイト:https://2y7c3.github.io/3DV-TON/
- arXiv技術論文:https://arxiv.org/pdf/2504.17414
3DV-TONの応用シナリオ
- オンラインショッピングこの機能を使えば、ユーザーは服をバーチャルに試着でき、ショッピング体験が向上し、返品率も低下します。
- ファッションデザインデザインやマーケティングを支援するために、服飾デザインの効果を素早く提示します。
- バーチャル試着室実店舗で服を試着する時間と労力を節約できます。
- 映画とゲームキャラクターの衣装デザインやカスタマイズを支援し、制作効率を向上させる。
- ソーシャルメディア試着動画を作成・共有するための楽しいツールをユーザーに提供します。