project
OmniConsistency - シンガポール国立大学が開発した画像スタイル変換モデル
OmniConsistencyは、シンガポール国立大学が開発した画像スタイル変換モデルで、複雑なシーンにおける様式化された画像の整合性の問題に対処します。このモデルは、2段階の学習プロセスを用いて、大規模なペアになった様式化データで学習されます。
オムニコンシステンシーとは何ですか?
シンガポール国立大学が開発したOmniConsistencyは、複雑なシーンにおける様式化された画像の整合性問題を解決する画像スタイル転送モデルです。このモデルは、大規模なペアの様式化データで学習され、スタイル学習と整合性学習を分離する2段階の学習戦略を採用することで、複数のスタイル間で意味的、構造的、および詳細な整合性を維持します。このモデルは、あらゆるスタイルのLoRAモジュールとのシームレスな統合をサポートし、効率的かつ柔軟な様式化効果を実現します。実験結果によると、OmniConsistencyはGPT-4oに匹敵する性能を発揮しながら、より高い柔軟性と汎化能力を提供します。
OmniConsistencyの主な機能
- スタイルの一貫性複数のスタイルにわたる画像において、スタイルの一貫性を維持し、スタイルの劣化を防いでください。
- コンテンツの一貫性目標は、スタイル化の過程で元の画像の意味と詳細を維持し、コンテンツの完全性を確保することです。
- スタイルの独立性あらゆるスタイルのLoRA(低ランク適応)モジュールとシームレスに統合し、様々なスタイルのスタイル化タスクをサポートします。
- 柔軟性従来の幾何学的制約(エッジグラフ、スケッチ、ポーズグラフなど)に頼ることなく、柔軟なレイアウト制御をサポートします。
OmniConsistencyの技術原則
- 2段階トレーニング戦略第1段階(スタイル学習)では、スタイル固有の複数のLoRAモジュールを個別に学習させ、それぞれが特定のスタイルの固有の詳細を捉えることに重点を置きます。第2段階(一貫性学習)では、ペアデータを用いて一貫性モジュールを学習させ、異なるスタイルのLoRAモジュールを動的に切り替えることで、一貫性モジュールが構造的および意味的な一貫性に重点を置き、スタイル固有の特徴を取り込むことを防ぎます。
- 一貫性のあるLoRAモジュール条件分岐には低ランク適応(LoRA)モジュールが導入され、条件分岐のみを調整することで、メインネットワークのスタイル設定機能への干渉を回避します。因果的アテンション機構を用いることで、条件トークンが内部的に相互作用する一方で、メイン分岐(ノイズトークンとテキストトークン)はクリーンな因果モデリングを維持します。
- 条件付きトークンマッピング(CTM)低解像度の条件付き画像が高解像度画像の生成を誘導し、マッピング機構に基づいて空間的な位置合わせが保証されるため、メモリと計算のオーバーヘッドが削減される。
- 機能の再利用拡散処理中、条件トークンの中間特徴はキャッシュされ、冗長な計算を回避し、推論効率を向上させます。
- データ駆動型一貫性学習我々は、22種類の異なるスタイルの画像ペア2,600組を含む高品質なペアリングデータセットを構築し、データ駆動型の手法で意味的および構造的な一貫性マッピングを学習した。
OmniConsistencyプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/showlab/OmniConsistency
- ハギングフェイスモデルライブラリ:https://huggingface.co/showlab/OmniConsistency
- arXiv技術論文:https://arxiv.org/pdf/2505.18445
- オンラインでデモを体験してください:https://huggingface.co/spaces/yiren98/OmniConsistency
OmniConsistencyの応用シナリオ
- 芸術創作アニメーション、油絵、スケッチなど、さまざまなアートスタイルを画像に適用することで、アーティストがスタイリッシュな作品を素早く制作できるよう支援します。
- コンテンツ生成コンテンツ制作において、特定のスタイルに合った画像を迅速に生成できるため、コンテンツの多様性と魅力を高めることができる。
- 広告デザイン視覚的な魅力とブランドの一貫性を高めるため、広告やマーケティング資料に一貫性のある画像を作成する。
- ゲーム開発ゲーム内でスタイリッシュなキャラクターやシーンを素早く生成し、開発効率を向上させます。
- 仮想現実(VR)と拡張現実(AR)ユーザーエクスペリエンスを向上させるために、様式化された仮想環境と要素を生成します。