project
GroundingBooth - Adobeは、複数の大学と共同で、テーマとテキストから画像へのマッピングのためのカスタムフレームワークを発表しました。
GroundingBoothは、セントルイスのワシントン大学、Adobe、パデュー大学の研究チームによって開発された、高度なテキストから画像へのカスタマイズフレームワークです。テキストと画像のアライメントモジュールとマスキングクロスアテンションレイヤーに基づいています。
GroundingBoothとは何ですか?
GroundingBoothは、セントルイス・ワシントン大学、Adobe、パデュー大学の研究チームが開発した、高度なテキストから画像へのカスタマイズフレームワークです。テキストと画像の整列モジュールとマスキングクロスアテンションレイヤーに基づいて、前景の被写体と背景のオブジェクトの正確な空間的整列を実現します。このフレームワークは、レイアウト、アイデンティティの保持、テキストと画像の整合性といった個々のニーズを満たす画像を生成し、複数のテーマのカスタマイズをサポートし、複雑なシーンでも高い精度を維持します。GroundingBoothは、テーマ主導の前景生成とテキスト主導の背景生成を統合的に実現した初の試みであり、高度にカスタマイズされたビジュアルコンテンツの作成を可能にします。
GroundingBoothの主な機能
- 単一テーマのカスタマイズユーザーが指定したテキスト説明と単一のテーマ画像に一致するカスタム画像を生成します。
- マルチテーマとテキストエンティティの共同カスタマイズ複数のテーマとテキスト要素を同時にカスタマイズでき、複数のオブジェクトとテキスト説明を含む複雑な画像を生成できます。
- 空間的な位置合わせ生成された画像内のオブジェクトが、入力されたレイアウト情報と空間的に整合していることを確認してください。
- 身元保護画像生成時に被写体の識別特徴を保持する。
- テキストと画像の配置生成された画像の内容がテキストの説明と一致していることを確認してください。
GroundingBoothの技術原則
- 特徴抽出テキストと画像の特徴埋め込みは、それぞれCLIPテキストエンコーダとDINOv2画像エンコーダに基づいて抽出されます。
- 接地モジュール接地マーカーは、テキストと画像の特徴を位置符号化によって入力レイアウト情報と組み合わせることによって生成されます。
- マスキングクロスアテンションレイヤーU-Netの各Transformerブロックでは、マスクされたクロスアテンション層を使用して前景と背景の特徴の組み合わせを制御し、特徴注入の精度を確保します。
- 正確なレイアウト制御学習および推論フェーズにおいてマスク付きクロスアテンション層を使用することで、生成される画像内のオブジェクトのサイズと位置を正確に制御することが可能になります。
- モデルトレーニングトレーニング段階では、モデルはテキストによる説明と参照オブジェクトに基づいて、正確な画像レイアウトを生成する方法を学習します。
- モデル推論推論フェーズでは、モデルは複数の参照オブジェクトを処理し、複製されたマスキングクロスアテンション層を通じてマルチトピックのカスタマイズを実現します。
- 文脈の混同を避ける生成プロセス中の文脈上の混乱を避けるため、トピック主導型の前景生成とテキスト主導型の背景生成を区別する。
GroundingBoothプロジェクトの住所
- プロジェクト公式サイト:groundingbooth.github.io
- arXiv技術論文:https://arxiv.org/pdf/2409.08520v1
GroundingBoothの応用シナリオ
- パーソナライズされた製品カスタマイズユーザーは、好みに合わせてカスタマイズされた製品画像を作成できます。例えば、特定の模様やテキストを印刷した、オリジナルのTシャツ、カップ、スマホケースなどを作成できます。
- 芸術創作アーティストやデザイナーは、GroundingBoothを使用して、特定のスタイルや要素を持つアート作品を生成します。
- ゲームデザインゲーム開発者はこのフレームワークを利用して、ゲーム内のキャラクター、シーン、アイテムなどを迅速に生成できます。
- 広告とマーケティングマーケターは、広告の魅力を高めるために、広告コピーに合わせたオリジナルの画像を作成する。
- ソーシャルメディアコンテンツの作成ユーザーは、特定のトピックやイベントに関連した、カスタマイズされた画像をソーシャルメディア上で共有する。
- 教育・研修資料教育者は、学習教材の魅力と効果を高めるために、特定の情報とレイアウトを用いた教育用画像を作成する。