AB
AiBoss
project

ConsiStory - トレーニングなしでトピックの一貫性を実現するためのテキストベースのグラフ手法

ConsiStoryは、NVIDIAとテルアビブ大学の研究者によって開発された、テキストから画像を生成するためのトレーニング不要の手法です。この手法を用いることで、元のスタイルと主題を維持しながら、さまざまなテキストスタイルに対応した画像を生成することが可能です。

ConsiStoryとは何ですか?

ConsiStoryは、NVIDIAとテルアビブ大学の研究者によって開発された、テキストから画像を生成するためのトレーニング不要の手法です。さまざまなテキストの手がかりに従い、スタイルと主題を維持しながら、画像をさまざまなシーンに迅速かつ自然に拡大縮小できます。ConsiStoryの核心となるアイデアは、事前学習済みのテキストから画像への変換モデルの内部アクティベーションを共有することで、画像生成中に主題の一貫性を実現することです。この手法はモデルの最適化や事前学習を必要としないため、一貫性のある画像を生成するプロセスが大幅に簡素化されます。

ConsiStoryの公式サイトへの入り口

ConsiStoryの主な特徴

  • 研修は不要ですConsiStoryは、事前学習済みのテキスト画像変換(T2I)モデルの最適化やカスタマイズを必要としないため、ユーザーは既存のモデルを直接使用して一貫性のある画像を生成でき、時間とリソースを大幅に節約できます。
  • 一貫性のあるトピック生成この手法を用いると、異なるテキストプロンプトの下で、同じ人物、動物、物体など、同じテーマ性を維持した一連の画像を生成できます。これは、絵本、キャラクターデザイン、仮想アセットの作成など、一貫した視覚要素を必要とするアプリケーションに非常に役立ちます。
  • フレーム間の一貫性ConsiStoryは、内部的な活性化共有と注意機構を通じて、生成された画像が、異なる背景や状況下でも、被写体の特徴において一貫性を維持することを保証します。
  • レイアウトの多様性生成される画像の多様性を高めるため、ConsiStoryは、画像レイアウトの過度な均一性を避けるために、アテンションドロップやクエリ特徴ブレンドなどの技術を採用しています。
  • 互換性この方法は、ControlNetなどの既存の画像編集ツールと互換性があり、それらと併用することで、より複雑な画像制御を実現できます。
  • 迅速な生成ConsiStoryはトレーニング手順を必要としないため、画像を迅速に生成でき、現在の最先端技術(SoTA)よりも約20倍高速です。

ConsiStoryの技術的原則

  • テーマのポジショニングConsiStoryは、生成プロセスの各段階において、まず生成された各画像内の被写体の位置を特定します。これは、モデルのクロスアテンション機能を分析することで行われ、被写体が含まれている可能性のある画像内の領域を特定するのに役立ちます。
  • トピック主導型の共有された注意ConsiStoryは自己注意機構を拡張し、画像内のクエリが自身の画像の特徴だけでなく、他の画像における被写体関連の特徴にも焦点を当てることを可能にします。これにより、同じ被写体の異なるインスタンスが生成中に互いに影響を与え合い、一貫性を維持することができます。背景とレイアウトの一貫性を制約するために、ConsiStoryは被写体マスクを使用して、被写体関連の特徴のみが共有されるようにします。
  • レイアウトの多様性の向上生成される画像の多様性を維持するために、ConsiStoryは2つの戦略を採用しています。1つ目は、非一貫性サンプリングステップからの特徴を生成された特徴と混合すること、2つ目は、共有アテンション処理中にランダムなアテンションドロップアウトを導入して、異なる画像間の過剰な一貫性を低減することです。
  • 機能注入被写体の一貫性、特に細部の再現性をさらに向上させるため、ConsiStoryは特徴注入メカニズムを導入しています。DIFT特徴量を用いて画像間の密な対応グラフを構築することで、ConsiStoryは異なる画像間で特徴量を正確に位置合わせしてブレンドし、被写体の一貫性を高めることができます。
  • 固定された画像と再利用可能なテーマ計算効率を向上させるため、ConsiStoryは生成された画像の一部を「アンカー画像」として選択できます。共有アテンション処理の段階では、アンカー画像のみが他の画像の特徴を共有し、それらから特徴を受け取ります。これにより、計算負荷が軽減されるだけでなく、生成品質が向上し、同じ被写体を新しいシーンで再利用することが可能になります。
  • 複数トピックの一貫性生成ConsiStoryは、複数の被写体を含む画像を扱うことができます。すべての被写体マスクの和集合を取るだけで、1枚の画像内で複数の被写体間の一貫性を維持できます。