AB
AiBoss
project

BrushNet - テンセントが開発した、高品質な画像復元モデル。

BrushNetは、Tencent PCGのARC Labsと香港大学の研究者によって開発された、拡散モデルに基づくプラグアンドプレイ型の画像修復モデルです。分解型デュアルブランチアーキテクチャを効果的に活用しています。

BrushNetとは何ですか?

BrushNetは、Tencent PCGのARC Labと香港大学の研究者によって開発された、拡散モデルに基づくプラグアンドプレイ型の画像修復モデルです。分解された2つのブランチからなるアーキテクチャにより、画像内のマスク領域を効果的に処理します。一方のブランチはマスクされた画像からピクセルレベルの特徴を抽出することに特化し、もう一方のブランチは画像生成を担当します。この設計により、BrushNetは重要なマスキング情報を階層的に修復プロセスにきめ細かく統合することができ、元の画像コンテンツの一貫性を維持しながら高品質な修復結果を生成します。

従来の画像復元手法(ブレンド潜在拡散、安定拡散インペインティング、HD-Painter、PowerPaintなど)と比較して、BrushNetの画像復元機能は、スタイル、コンテンツ、色、およびキューアライメントの点で優れた一貫性を示します。

BrushNet公式サイトへの入り口

BrushNetの特徴

  • さまざまな種類の画像を修復しますBrushNetは、人物、動物、屋内、屋外など、さまざまなシーンの画像を修復できるだけでなく、自然画像、鉛筆画、アニメ、イラスト、水彩画など、さまざまなスタイルの画像を修復することもできます。
  • ピクセルレベルの修復BrushNetは、画像内のマスクされた領域を識別して処理し、各ピクセルに対して正確な修復を行うことで、修復された領域と元の画像との視覚的にシームレスな統合を実現します。
  • マスクを着用していないエリアを保護するBrushNetは、階層的な制御と特定のぼかし融合戦略を用いることで、復元プロセス中にマスクされていない領域を保持し、元の画像コンテンツへの不要な変更を回避することができます。
  • 事前学習済みモデルとの互換性BrushNetはプラグアンドプレイモデルとして、様々な事前学習済み拡散モデル(DreamShaper、epiCRealism、MeinaMixなど)と組み合わせることで、それらの強力な生成能力を活用し、修復タスクを完了させることができます。
  • 柔軟性と制御性ユーザーは、修復領域のサイズや修復内容の詳細度など、モデルのパラメータを調整することで、修復の規模と詳細度を制御できます。

BrushNetの仕組み

BrushNetは、革新的な2分岐アーキテクチャを通して、拡散モデルを用いて画像修復タスクを実行します。

BrushNetの仕組みについて簡単に説明します。

  1. デュアルブランチアーキテクチャBrushNetの中核は、分解された2つのブランチからなるアーキテクチャであり、一方のブランチはマスクされた画像の特徴処理に特化し、もう一方のブランチは画像の残りの部分を生成する役割を担っている。
  2. マスク画像の特徴抽出マスキング処理では、モデルは変分オートエンコーダー(VAE)を用いてマスクされた画像をエンコードし、その潜在特徴を抽出します。抽出された特徴は、画像復元処理の指針として使用されます。
  3. 事前学習済み拡散モデル生成ブランチでは、モデルは事前学習済みの拡散モデルを使用して画像コンテンツを生成します。このモデルは、ノイズから鮮明な画像を復元する方法を学習済みです。
  4. 機能融合抽出されたマスキング画像の特徴は、事前に学習された拡散モデルに段階的に統合され、階層的な方法で復元プロセスを詳細に制御することが可能になります。
  5. ノイズ除去と生成逆拡散処理中、モデルはノイズ除去ステップを繰り返し実行することで、ノイズから鮮明な画像を復元します。各ステップでは、マスクされた画像の特性を考慮し、修復された領域が元の画像の残りの部分と視覚的に一致するようにします。
  6. ファジー融合戦略マスクされていない領域のディテールをより良く保持するために、BrushNetはぼかしとブレンドの手法を採用しています。つまり、マスクされた領域と生成された領域をブレンドする際に、ぼかしマスクを使用して、硬いエッジや不自然な遷移を軽減します。
  7. 出力修復画像最終的に、このモデルは、マスクされた領域が自然かつ一貫性をもって塗りつぶされ、マスクされていない領域の元のコンテンツが保持された修復画像を出力する。