AB
AiBoss
project

DiffuEraser - Ali Tongyi Labsが開発したビデオ修復モデル

DiffuEraserは、安定した拡散モデルに基づいたビデオインペインティングモデルで、ビデオ内のマスクされた領域をより詳細かつ一貫性のある構造で塗りつぶします。このモデルは、事前情報を組み込むことで初期化と弱い条件を提供し、これにより...

DiffuEraserとは何ですか?

DiffuEraser は、安定した拡散モデルに基づくビデオ インペインティング モデルで、ビデオ内のマスクされた領域をより詳細かつ一貫性のある構造で埋めます。このモデルは、事前情報を組み込むことで初期化と弱い条件を提供し、ノイズ アーティファクトの低減と幻覚の抑制に役立ちます。長いシーケンス推論中の時間的一貫性を向上させるために、DiffuEraser は事前モデルと自身の時間的受容野を拡張し、ビデオ拡散モデルの時間的平滑化特性に基づいて一貫性をさらに強化します。AnimateDiff に触発され、DiffuEraser のネットワーク アーキテクチャはモーション モジュールを画像インペインティング モデルに統合します。これは主に、メインのノイズ除去 UNet と補助的な BrushNet で構成されています。BrushNet ブランチは、マスクされた画像、マスク、およびノイズ潜在変数からなる条件付き潜在変数入力を受け取ります。BrushNet によって抽出された特徴は、ゼロ畳み込みブロックを通過した後、層ごとにノイズ除去 UNet に統合されます。ノイズ除去 UNet はノイズ潜在変数を処理します。時間的な一貫性を高めるため、自己注意層と相互注意層の後に時間的注意機構を導入する。ノイズ除去後、生成された画像は、ぼかしマスクを用いて入力マスク画像と融合される。

DiffuEraserの主な機能

  • 未知のピクセルの生成安定した拡散モデルの強力な生成能力に基づき、DiffuEraserは、これまでビデオに登場したことのないピクセルに対しても、豊かなディテールとテクスチャを備えた適切なコンテンツを生成できます。これにより、従来のTransformerモデルで大きなマスクを扱う際によく見られるぼやけやモザイクの問題を効果的に解決します。
  • 既知ピクセルの伝播DiffuEraserは、モーションモジュールと事前モデルを通じて伝播機能を強化し、既知のピクセル(マスクされたフレームに現れたピクセル)が異なるフレーム間で十分かつ一貫して伝播されるようにします。これにより、修復されたコンテンツとマスクされていない領域間の競合を防ぎ、結果の精度と安定性を向上させます。
  • 時間的一貫性の維持長尺シーケンス推論において、DiffuEraserは、ビデオ拡散モデルの時間的平滑化特性に基づいて、事前モデルと自身の時間的受容野を拡張することにより、すべてのフレームにわたる完成コンテンツの時間的一貫性を向上させます。
  • 事前情報の注入DiffuEraserは、事前情報を注入することで初期化と弱い条件を提供し、ノイズアーティファクトの低減、拡散モデルでよく見られる視覚的錯覚の抑制、より正確で現実的な修復結果の生成に役立ちます。
  • ネットワークアーキテクチャの最適化DiffuEraserのネットワークアーキテクチャはAnimateDiffに着想を得ています。画像修復モデルであるBrushNetにモーションモジュールを統合し、自己注意層と相互注意層の後に時間的注意機構を導入することで、時間的な一貫性をさらに向上させています。

DiffuEraserの技術原理

  • ネットワークアーキテクチャAnimateDiff に触発された DiffuEraser のネットワーク アーキテクチャは、モーション モジュールを画像修復モデル BrushNet に統合しています。このアーキテクチャは主に、メインのノイズ除去 UNet と補助的な BrushNet で構成されています。BrushNet ブランチは、マスク画像、マスク自体、およびノイズ潜在変数からなる条件付き潜在変数入力を受け取ります。抽出された特徴は、ゼロ畳み込みブロックを通過した後、層ごとにノイズ除去 UNet に統合されます。ノイズ除去 UNet はノイズ潜在変数を処理します。時間的一貫性を高めるために、自己注意層と相互注意層の後に時間的注意機構が導入されています。ノイズ除去後、生成された画像はぼかしマスクを使用して入力マスク画像と融合されます。
  • ビデオ修復に関する問題点の内訳DiffuEraserは、ビデオ復元問題を3つのサブ問題に分解します。既知のピクセルの伝播、未知のピクセルの生成、そして完成したコンテンツの時間的一貫性の維持です。
  • 時間一貫性最適化長いシーケンス推論における時間的一貫性を向上させるため、DiffuEraserは以下の戦略を採用しています。
    • 以前のモデルの時間的受容野を拡張する事前伝播と事前推論を通じて、事前モデルは既知のピクセルを時間領域全体にわたって伝播させることができ、完成したコンテンツとマスクされていない領域との間の一貫性を確保し、結果を安定させることができます。
    • DiffuEraserの時間的受容野の拡張DiffuEraserは事前推論を用いることで、より広範囲のビデオフレームを処理することが可能になり、長尺シーケンス推論中に生成されるコンテンツの一貫性を確保します。

DiffuEraserプロジェクトのアドレス

DiffuEraserの応用事例

  • 映画やテレビシリーズのポストプロダクション映画やテレビシリーズのポストプロダクションにおいて、DiffuEraserは、ビデオ内のマスクされた領域の修復、ビデオ品質の向上、デブラーリングや超解像処理の実行、およびさまざまな解像度の再生要件への適応に使用できます。
  • 古いフィルムの修復古い映画のデジタル修復において、DiffuEraserはフィルムの傷、埃、その他の劣化を取り除き、解像度を向上させ、古い映画に新たな命を吹き込むことができます。
  • 強化された監視ビデオセキュリティ監視の分野において、DiffuEraserは監視ビデオの鮮明度を高め、細部の識別を容易にし、監視効率を向上させることができます。
  • 動画コンテンツ変換コンテンツ制作者は、DiffuEraserを使用して、標準画質(SD)のビデオコンテンツを高画質(HD)または4Kに変換し、最新のディスプレイデバイスのニーズに対応させることができます。
  • スポーツの生中継ライブスポーツ中継において、DiffuEraserはリアルタイムのビデオストリームを強化し、より鮮明な視聴体験を提供するために使用できます。