project
OmniBooth - Huawei Noah's Arkと香港科技大学が共同開発した画像生成フレームワーク
OmniBoothは、ファーウェイ・ノアズアーク・ラボと香港科技大学の研究チームが共同開発した画像生成フレームワークです。テキストプロンプトまたは画像参照に基づいて、空間制御とインスタンスレベルのカスタマイズをサポートします。このフレームワークは、ユーザー定義のマスクと関連する...
OmniBoothとは何ですか?
OmniBoothは、Huawei Noah's Ark Labと香港科技大学(HKUST)の研究チームが共同開発した画像生成フレームワークです。テキストプロンプトまたは画像参照に基づく空間制御とインスタンスレベルのカスタマイズをサポートします。このフレームワークは、ユーザー定義のマスクと関連付けられたテキストまたは画像を使用して、画像内のオブジェクトの位置と属性を正確に制御し、テキストから画像への合成技術の制御性と実用性を向上させます。OmniBoothの中核は、革新的な潜在制御信号にあります。これは、空間、テキスト、および画像条件をシームレスに統合して、きめ細かな画像合成制御を実現する高次元空間特徴です。
OmniBoothの主な機能
- マルチモーダルコマンド制御テキストプロンプトまたは画像参照による画像生成の制御をサポートし、マルチモーダルコマンドによる画像合成を可能にします。
- スペース制御とインスタンスレベルのカスタマイズユーザー定義のマスクとテキストまたは画像によるガイダンスにより、画像内のオブジェクトの位置と属性を正確に制御でき、インスタンスレベルでのカスタマイズが可能になります。
- 高次元ポテンシャル制御信号潜在的な制御信号に基づいて、空間、テキスト、画像条件をシームレスに統合し、統一的な表現方法を提供する。
- 柔軟性と実用性ユーザーは必要に応じてテキストまたは画像をマルチモーダルな条件として選択でき、生成される画像の柔軟性と実用性が向上します。
OmniBooth の技術原則
- マルチモーダル埋め込み抽出:
- テキスト埋め込みCLIPテキストエンコーダを使用して、テキストプロンプトの埋め込みベクトルを抽出します。
- 画像埋め込みDINOv2特徴抽出器は、画像の識別情報と空間情報を保持しながら、画像参照の埋め込みベクトルを抽出するために使用されます。
- 潜在的な制御信号テキストと画像はベクトルに埋め込まれ、空間情報と豊富な潜在的特徴を含む高次元の潜在制御信号としてプロットされる。
- 空間変形技術空間変形技術を用いることで、画像の詳細や構造を保持しながら、画像を効果的に変換し、潜在的な制御信号へと統合することができる。
- 特徴アライメントネットワークとエッジ損失関数:
- 潜在特徴に条件を注入するための特徴アライメントネットワークを開発する。
- 我々は、高周波領域における監視を強化するためにエッジ損失を提案し、それによって生成される画像の品質と構造的な整合性を向上させる。
- マルチスケールトレーニングとランダムモード選択戦略トレーニング段階では、モデルはマルチスケールトレーニングとランダムなモダリティ選択戦略を採用し、さまざまな解像度やモダリティ入力への適応性を高めます。
OmniBoothのプロジェクトアドレス
- プロジェクト公式サイト:len-li.github.io/omnibooth
- GitHubリポジトリ:https://github.com/EnVision-Research/OmniBooth
- ハギングフェイスモデルライブラリ:https://huggingface.co/lilelife/OmniBooth
- arXiv技術論文:https://arxiv.org/pdf/2410.04932
OmniBoothの適用シナリオ
- データセットの生成機械学習モデルのトレーニングに必要な合成データセットを生成する。特に、実世界のデータを入手するのが難しい場合に有効である。
- コンテンツ作成アーティストやデザイナーは、テキストや画像を参考にしながら、イラストやコンセプトアートなどの新しいビジュアルコンテンツを制作し、創造的なアイデアを実現します。
- ゲームとエンターテイメントゲーム開発においては、ゲーム環境、キャラクター、アイテムなどのプロトタイプデザインを迅速に生成するために使用される。
- 仮想現実(VR)と拡張現実(AR)ユーザーエクスペリエンスを向上させるため、仮想環境向けにリアルな背景やオブジェクトを作成する。
- 広告とマーケティング広告画像やマーケティング資料を迅速に作成し、顧客のニーズに合わせてカスタマイズできます。