AB
AiBoss
project

OminiControl - 画像の被写体と空間構成を正確に制御できるAI画像生成フレームワーク。

OminiControlは、FLUX.1などの拡散変換モデル向けに設計された、非常に汎用性が高くパラメータ効率に優れた画像生成フレームワークであり、画像生成プロセスをきめ細かく制御できます。OminiControlは、被写体主導型制御と空間制御をサポートしています。

OminiControlとは何ですか?

OminiControlは、FLUX.1などの拡散トランスフォーマーモデル向けに設計された、汎用性が高くパラメータ効率に優れた画像生成フレームワークです。画像生成プロセスをきめ細かく制御できます。OminiControlは、エッジガイド生成やペインティング生成など、被写体主導型および空間制御をサポートしており、基本モデルのパラメータをわずか0.1%増やすだけで済みます。OminiControlは、提供されたソース素材を新しい画像にシームレスに統合し、高い画像品質と被写体の一貫性を維持します。OminiControlは、被写体の一貫性を維持した生成タスクの研究を支援するために、20万枚以上の画像を含むSubjects200Kデータセットを提供します。

OminiControlの主な機能

  • テーマ主導型の制御ユーザーが提供したメイン画像とテキストプロンプトに基づいて新しい画像を生成し、主要な特徴を維持しつつ、テキストの説明に従って背景やシーンを変更します。
  • 空間位置合わせ制御このフレームワークは、エッジガイダンスやペイント生成など、正確な空間対応を必要とする画像生成タスクをサポートします。
  • マルチモーダルな注意相互作用OminiControlは、条件付き画像、ノイズ画像、テキスト条件付きタグの処理を統合することで、直接的なマルチモーダルな注意相互作用を可能にし、情報交換と制御信号伝播の効率を向上させます。
  • パラメータ効率他の方法と比較して、OminiControlは効率的な画像状態制御を実現するために、ごくわずかな割合(0.1%)の追加パラメータを導入するだけです。
  • 柔軟性と均一性これは、空間アライメントと非空間アライメント制御タスクを処理するための統一されたアーキテクチャを提供し、システムの柔軟性を向上させます。

OminiControlの技術原理

  • パラメータ再利用メカニズム条件付き画像は、モデルの既存のVAEエンコーダを使用して処理され、ノイズ画像のラベルと同じ潜在空間のラベルにエンコードされます。
  • 統一シーケンス設計ノイズを含む画像ラベル、テキストラベル、および条件付き画像ラベルは、統一されたシーケンスに統合され、条件付き画像がマルチモーダル注意メカニズムに直接参加できるようになります。
  • 適応型位置埋め込み条件付き画像ラベルに位置インデックスを割り当てることで、ノイズの多い画像ラベルとの効果的なやり取りが保証され、これは空間アライメントと非空間アライメントの両方のタスクにとって非常に重要です。
  • 条件付き強度係数: バイアス項を導入して注意重みを調整し、推論中の条件付き画像の影響を手動で調整できるようにします。
  • マルチモーダル注意操作DiTの各Transformerブロックでは、画像とテキストの条件付きタグ間の相互作用は、アテンションメカニズムに基づいて実装されています。

OminiControlのプロジェクトアドレス

OminiControlの応用シナリオ

  • 芸術的な創造とデザインアーティストやデザイナーは、特定のスタイルやテーマに基づいてイメージを制作したり、既存のデザイン要素を新しい作品に取り入れたりする。
  • ゲーム開発ゲーム開発者は、ゲーム環境、キャラクター、アイテムのコンセプトアートを素早く作成したり、プレイヤーの選択に基づいてゲーム内アイテムをカスタマイズしたりすることができる。
  • 映画・エンターテインメント業界映画製作においては、これは特定の物体や人物を異なる背景に組み込むなど、シーンを作成または変更することを含む。
  • 広告とマーケティングマーケターは、製品をさまざまな場面に自然に溶け込ませた魅力的な広告画像を作成し、広告の魅力を高めている。
  • 仮想現実(VR)と拡張現実(AR)VRおよびARアプリケーションでは、リアルな仮想環境とオブジェクトを生成し、ユーザーエクスペリエンスを向上させます。