project
FluxSR - 上海交通大学、ファーウェイ、その他の大学が共同開発した画像超解像モデル。
FluxSRは、上海交通大学、ハーバード大学、華南理工大学、およびファーウェイ・ノアズアーク・ラボが開発した、実世界の画像超解像(Real-ISR)タスクに特化した新しい単段階拡散モデルです。FluxSRは…
FluxSRとは何ですか?
FluxSRは、上海交通大学、ハーバード大学、華南理工大学、およびファーウェイ・ノアズアーク・ラボが、実世界の画像超解像(Real-ISR)タスク向けに開発した、斬新なシングルステップ拡散モデルです。FLUX.1-devテキスト・トゥ・イメージ(T2I)拡散モデルをベースに、FluxSRはフロー軌跡蒸留(FTD)技術を用いて、マルチステップフローマッチングモデルをシングルステップ超解像モデルに蒸留します。FluxSRの最大の特長は、T2Iモデルの高いリアリズムを維持しながら、高品質な超解像画像を効率的に生成できる点にあります。FluxSRは、TV-LPIPS知覚損失とアテンション多様化損失(ADL)を用いて、高周波の詳細を最適化し、アーティファクトを低減します。FluxSRは、複数のデータセットで優れた性能を発揮し、特に参照画像なしの画像品質評価指標において卓越した性能を示し、計算コストを大幅に削減し、効率的かつ高品質な画像超解像のための新たなソリューションを提供します。
FluxSRの主な機能
- 高効率単一ステップ超解像再構成単一ステップ拡散処理において、低解像度画像を効率的に高解像度画像に復元することで、計算コストと推論遅延を大幅に削減し、高速画像処理のニーズに適しています。
- 高忠実度画像生成事前学習済みのテキスト画像変換(T2I)モデルから高精細な詳細情報を抽出し、それを超解像タスクに適用することで、詳細かつ高精細な画像が生成される。
- 高周波ディテール復元とアーティファクト抑制画像の高周波成分を効果的に復元し、高周波ノイズや反復パターンを低減することができます。
FluxSRの技術原則
- 流れ軌跡蒸留(Flow Trajectory Distillation, FTD):
- ノイズから画像へのストリーム生成事前学習済みのT2Iモデルを使用して、画像にノイズストリームを生成します。
- 低解像度から高解像度ストリーミングへの変換LRからHRへの流れの軌跡は、数学的な関係に基づいて導出され、SRの流れを直接最適化することによって生じる分布のずれを回避します。
- 単段階拡散モデルのトレーニング戦略大規模モデルに適したトレーニング戦略に基づき、ノイズと画像のストリーミングデータペアをオフラインで生成することで、トレーニング中に追加の教師モデルに依存する必要がなくなります。これにより、メモリ消費量とトレーニングコストが大幅に削減され、シングルステップのモデルトレーニングがより効率的になります。
- 知覚された損失と正規化:
- TV-LPIPSの知覚損失全変動(TV)損失とLPIPS(学習済み知覚画像パッチ類似性)損失を組み合わせることで、高周波成分の復元を重視し、生成画像におけるアーティファクトを低減します。
- 注意力の分散(ADL)の喪失このアプローチは、トランスフォーマー内の異なるトークン間の類似性を低減し、注意の多様性を高め、高周波アーティファクトを除去します。
- 効率的な推論推論段階では単一のフローモデルのみを使用するため、多段階拡散モデルの高い計算負荷を回避できます。FTD技術に基づき、多段階モデルに匹敵するリアリズムを維持しながら、単一のステップで高品質の超解像画像を生成します。
FluxSRプロジェクトのアドレス
- GitHubリポジトリ:https://github.com/JianzeLi-114/FluxSR
- arXiv技術論文:https://arxiv.org/pdf/2502.01993
FluxSRの応用シナリオ
- 古い写真の修復解像度が低い、ぼやけている、または破損している古い写真を、高解像度で鮮明な画像に復元します。
- 映画およびテレビ制作映画やテレビのポストプロダクションでは、低解像度の映像を高解像度にアップスケールして、高精細度(HD)や4K制作の要求を満たす。
- 医療画像の向上これは、低解像度の医療画像(X線、CTスキャン、MRIなど)の解像度を向上させ、医師がより正確に病気を診断するのに役立ちます。
- スマートフォン写真スマートフォンで撮影した低解像度の写真の鮮明度を向上させます。特に、暗い場所や動きの速いシーンで効果を発揮します。
- 品質検査工業生産においては、生産ライン上の画像検査システムの解像度を向上させることで、製品の欠陥をより正確に検出するのに役立つ。