project
ResAdapter - ByteDance製の拡散モデル解像度アダプタ
ByteDanceの研究者によって開発されたResAdapterは、拡散モデル(安定拡散など)向けに設計された解像度アダプタであり、これらの画像生成モデルが任意の解像度とアスペクト比で画像を生成できるようにするものです。
ResAdapterとは何ですか?
ByteDanceの研究者によって開発されたResAdapterは、拡散モデル(Stable Diffusionなど)向けに設計された解像度アダプタです。これにより、これらの画像生成モデルは、元のスタイルドメインを維持しながら、任意の解像度とアスペクト比で画像を生成できるようになります。拡散モデルは通常、トレーニング中に特定の解像度での画像生成能力のみを学習するため、ユーザーがトレーニング解像度範囲を超える画像を生成しようとすると、高品質の結果(歪んだ画像や異常な四肢など)が得られない場合があります。ResAdapterは、モデルが生成する画像の解像度範囲とアスペクト比を元のスタイルドメインを変更せずに拡張することで、この問題を解決することを目指しています。
ResAdapterの公式サイトのエントリー
- 公式プロジェクトホームページ:https://res-adapter.github.io/
- GitHubリポジトリ:https://github.com/bytedance/res-adapter
- ハグ顔モデル:https://huggingface.co/jiaxiangc/res-adapter
- arXivの研究論文:https://arxiv.org/abs/2403.02084
ResAdapterの機能
- 解像度補間これにより、モデルはトレーニング時の解像度よりも低い解像度で画像を生成できるようになり、結果として、ディテールと品質を維持しながら、より小さな画像が得られる。
- 解像度外挿これにより、モデルは学習時の解像度よりも高い解像度で画像を生成できるようになります。これは、印刷や大型ディスプレイなど、高解像度出力が必要なアプリケーションにとって非常に重要です。
- ドメインの一貫性ResAdapterは、異なる解像度で画像を生成する際に、トレーニング中に画像のスタイルがスタイルドメインと一貫しているようにすることで、解像度が変更されたときに発生する可能性のあるスタイルの歪みや不整合を回避します。
- プラグアンドプレイResAdapterは、モデルアーキテクチャに大きな変更を加えることなく、既存の拡散モデルに容易に統合できるように設計されており、さまざまなモデルやアプリケーションシナリオに迅速に適用できます。
- 互換性ResAdapterは基本的な拡散モデルと互換性があるだけでなく、ControlNet、IP-Adapter、LCM-LoRAなどの他の画像生成関連モジュールと組み合わせて使用することで、より複雑な画像生成タスクを実現することもできます。
ResAdapterの仕組み
- 分析モデル構造まず、拡散モデル(安定拡散など)のUNetアーキテクチャを分析し、どの層が解像度に敏感かを判断します。一般的に、畳み込み層は受容野が固定されているため、解像度に敏感です。
- ResCLoRAを挿入する解像度ベースの畳み込みLoRA(ResCLoRA)は、UNetアーキテクチャのダウンサンプラーとアップサンプラーの畳み込み層に組み込まれています。ResCLoRAは、低ランク行列を追加することで畳み込み層の受容野を動的に調整し、異なる解像度の入力画像に適応できるようにします。
- ResENormのご紹介解像度外挿の問題に対処するため、解像度外挿正規化(ResENorm)が導入されました。ResENormは、高解像度画像の統計的分布に適応するために、UNetブロック内のグループ正規化層のみを学習させ、同時にモデルの元のスタイル領域への適応性を維持します。
- マルチ解像度トレーニングトレーニング中は、異なる解像度の画像データセットが使用されます。この混合解像度トレーニング戦略により、ResAdapterは元のスタイル領域への影響を避けつつ、異なる解像度で画像を生成する能力を学習できます。
- 拡散モデルへの統合トレーニング後、ResAdapterはプラグアンドプレイモジュールとして、あらゆるスタイルの拡散モデルに統合できます。つまり、元のモデルがどのスタイル領域に焦点を当てているかに関わらず、ResAdapterは生成される画像の解像度範囲を拡張できるということです。
- 画像を生成する推論フェーズでは、ResAdapterと統合された拡散モデルが、ユーザーのニーズに応じて任意の解像度の画像を生成できます。このモデルは、入力されたテキストプロンプトや条件(ControlNetが提供する画像条件など)に基づいて、反復的なノイズ除去処理によって高品質の画像を生成します。