project
AnyStory - Alitongyiが開発した、高精度なパーソナライズされたテキストから画像を生成するフレームワーク
AnyStoryは、アリババ傘下のTongyi Labが開発した革新的なテキスト画像生成フレームワークであり、単一または複数の被写体に対して高精度なパーソナライズ画像生成を可能にします。被写体のパーソナライズは、「エンコーディング・ルーティング」方式を用いてモデル化されています。
AnyStoryとは何ですか?
AnyStoryは、Alibaba Tongyi Labが開発した革新的なテキストから画像への生成フレームワークで、単一または複数の被写体に対して高忠実度のパーソナライズされた画像生成を可能にします。被写体のパーソナライズは、「エンコーディング・ルーティング」アプローチでモデル化されます。エンコーディング段階では、AnyStoryは強力なReferenceNetとCLIPビジュアルエンコーダを組み合わせて、被写体の特徴を高忠実度でエンコードし、豊富な詳細と意味情報を捉えます。ReferenceNetは高解像度の入力をサポートし、ノイズ除去U-Netの特徴空間と整合することで、生成画像の詳細の確固たる基盤を提供します。CLIPビジュアルエンコーダは、被写体の大まかな概念を抽出する役割を担い、生成画像がテキストの説明と密接に一致するようにします。ルーティング段階では、分離されたインスタンス認識型被写体ルーターが、潜在空間における被写体の位置を正確に認識および予測し、被写体条件の注入をガイドすることで、複数被写体生成でよく発生する被写体混合問題を効果的に回避し、各被写体が生成画像内で独自の特徴と詳細を保持できるようにします。
AnyStoryの主な特徴
-
高精度な単体パーソナライゼーションAnyStoryは、特定の被写体について高精細な画像を生成し、豊富な詳細情報や意味情報を捉え、生成された画像をテキストによる説明と密接に一致させることができます。
-
複数科目のパーソナライゼーション複数の被験者が関わるシナリオにおいて、AnyStoryは潜在空間における各被験者の位置を正確に認識・予測し、被験者条件の注入を誘導し、複数被験者生成でよく発生する被験者混在問題を回避し、生成された画像において各被験者が固有の特徴と詳細を保持できるようにします。
-
テキストの説明の配置AnyStoryは、CLIPビジュアルエンコーダーを通して被写体の概略的な概念を抽出することで、生成される画像がテキストの説明と密接に一致するようにし、生成された画像とテキストの説明との一貫性を確保します。
-
詳細が保存されていますReferenceNetをベースとしたAnyStoryは、被写体の細部を保持し、高品質な画像生成をサポートすることができます。
-
柔軟な被験者条件注射AnyStoryは、分離型のインスタンス認識型サブジェクトルーターを使用することで、サブジェクト条件を潜在空間に柔軟に注入し、生成される画像を正確に制御することを可能にします。
AnyStoryの技術原則
- エンコード段階
-
ReferenceNetReferenceNetは、高解像度入力に対応し、被写体の微細なディテールを抽出できる汎用性の高い強力な画像エンコーダです。ReferenceNetの特徴空間は、ノイズ除去を行うU-Netと整合しており、U-Netは様々な深度とスケールで被写体の特徴を直接抽出できます。ReferenceNetは、変分オートエンコーダ(VAE)を用いて参照画像をエンコードし、U-Netと同じアーキテクチャを持つネットワークを通してその特徴を抽出します。
-
CLIPビジュアルエンコーダーCLIPビジュアルエンコーダーは、被写体の概略的な概念を抽出し、生成される画像がテキストの説明と密接に一致するようにする役割を担っています。CLIPの特徴は主に意味論的なものであり、解像度は低いものの、テキスト埋め込みとよく一致する特徴を提供し、被写体の生成を促します。
-
- ルーティングフェーズ
-
分離型ルーティングメカニズムこのアルゴリズムは、独立した分岐を通して潜在空間における対象の位置を予測します。セグメント化された一連の対象画像が与えられると、CLIP画像エンコーダと追加のシングルクエリQFormerによってルーティング特徴量が取得されます。これらの特徴量は、画像セグメンテーションデコーダを介してルーターをモデル化し、粗いルーティンググラフを生成するために使用されます。その後、マスク付きクロスアテンションモジュールによってこのグラフが洗練され、対象情報の注入がガイドされます。
-
インスタンス認識ルーティング正則化損失ルーターの学習と異なる対象インスタンスの識別を容易にするため、インスタンス認識型ルーティング正則化損失が導入される。この損失関数により、ルーターは対象の特徴を適切な領域に正確にルーティングし、無関係な領域への影響を軽減する。
-
ルーティングガイダンスのための主要情報の注入CLIPエンコードされた被験者表現については、デカップリングされたクロスアテンションを使用してU-Netに統合し、ルーティングによって誘導されるローカリゼーション制約を強化します。ReferenceNetエンコードされた被験者特徴については、元の参照アテンションを使用し、ルーティンググラフによって誘導されるアテンションマスクを追加して、被験者特徴がターゲット領域に正確に注入されるようにします。
-
- トレーニング段階
-
メインエンコーダーのトレーニングトレーニングプロセスには、QFormer、ReferenceNet、およびアテンションブロック内の対応するキーバリュー行列が含まれます。ReferenceNetは、事前学習済みのU-Netの重みを使用して初期化され、被験者の同一性を維持しつつ、背景、姿勢、視点に変化を持たせた大量のペアデータが収集され、トレーニングに使用されます。これにより、被験者の過学習を防ぎます。
-
ルーターのトレーニング固定被写体エンコーダを使用してルーターを学習させます。主な学習データには、ペアになっていない複数人物の画像も含まれています。CLIPモデルの高い汎化能力と、高度に圧縮されたシングルトークンルーティング機能のおかげで、ルーターは様々な被写体に効果的に汎化することができます。
-
AnyStoryのプロジェクトアドレス
- プロジェクト公式サイト:https://aigcdesigngroup.github.io/AnyStory
- arXiv技術論文:https://arxiv.org/pdf/2501.09503v1
AnyStory アプリケーションシナリオ
-
クリエイティブペインティングアーティストはAnyStoryを使って、自身の創造的なアイデアを視覚的な作品へと変換できます。AnyStoryは、特定のクライアント向けにパーソナライズされたポートレートを作成するための高品質な画像生成機能を提供し、制作期間を短縮します。
-
コンセプトデザインデザインの初期段階において、AnyStoryはアーティストやデザイナーがコンセプトアートを迅速に作成するのに役立ち、その後の詳細設計の参考資料として活用できます。
- キャラクターコンセプトアートゲームデザイナーはAnyStoryを使用することで、ゲームの背景ストーリーやキャラクター設定に基づいて、複数のキャラクターのコンセプトアートを迅速に生成できます。
-
漫画制作これは、漫画家がキャラクターやシーンを素早く生成するためのツールを提供し、制作プロセスを加速させ、作品の視覚効果を向上させる。
- パーソナライズされた広告ターゲット層やマーケティングテーマに応じて、特定の製品やブランド要素を含む画像を迅速に生成し、広告の魅力と効果を高めることができます。