project
Hyper-SD - ByteDanceが発表した高効率画像合成フレームワーク
Hyper-SDは、ByteDanceの研究者によって開発された高効率画像生成フレームワークです。軌道分割一貫性蒸留(TSCD)技術と、人間のフィードバック学習および分画蒸留を組み合わせることで、拡散モデルのパフォーマンスを大幅に向上させ、より少ないデータ量で効率的な画像生成を実現します。
Hyper-SDとは何ですか?
ByteDanceの研究者によって開発されたHyper-SDは、多段階推論における既存の拡散モデルの高い計算コストに対処するために設計された、高効率な画像合成フレームワークです。Hyper-SDは、軌跡分割一貫性蒸留(TSCD)を利用して、異なる期間にわたるデータの一貫性を維持し、元の常微分方程式(ODE)の軌跡を効果的に保持します。さらに、低ステップ推論シナリオにおけるモデルのパフォーマンスを最適化するために人間のフィードバック学習を取り入れ、単段階推論における画像品質をさらに向上させるために分数蒸留を活用しています。このフレームワークは、高い画像品質を維持しながら必要な推論ステップを大幅に削減し、高解像度画像の迅速な生成を可能にし、生成AIの分野をさらに発展させます。
Hyper-SD公式サイトへの入り口
- 公式プロジェクトホームページ:https://hyper-sd.github.io/
- ハグフェイスモデルの住所:https://huggingface.co/ByteDance/Hyper-SD
- arXivの研究論文:https://arxiv.org/abs/2404.13686
- Hyper-SD T2I バージョン デモ:https://huggingface.co/spaces/ByteDance/Hyper-SDXL-1Step-T2I
- Hyper-SD Doodle デモ:https://huggingface.co/spaces/ByteDance/Hyper-SD15-Scribble
Hyper-SDの仕組み
- 軌道分割整合蒸留(TSCD):トレーニング時間ステップ範囲[0, T]は、k個の均一な時間間隔に分割されます。各期間内で一貫した蒸留処理が行われ、元のモデルを教師として使用することで、生徒モデルは教師モデルの挙動を徐々に学習していく。時間間隔の数を徐々に減らしていく(例:8 → 4 → 2 → 1)ことで、生徒モデルは教師モデルの全体的な挙動を近似するように訓練される。
- 人間によるフィードバック学習(ReFL):このモデルは、画像に対する人間の好みに関するフィードバックを活用することで最適化されています。報酬モデルを訓練して、人間の美的感覚により合致した画像を認識し、報酬を与えるようにする。学生モデルは、反復的なノイズ除去と直接予測、そして報酬モデルからのフィードバックを組み合わせることによって微調整される。
- 分別蒸留:真偽分布に基づいたスコアリング関数を用いて、単一ステップの推論プロセスを誘導する。2つの分布間のKLダイバージェンスを最小化することにより、学生の単一ステップ生成パフォーマンスが最適化される。
- 低ランク適応(LoRA):LoRA技術を用いて学生モデルの適応とトレーニングを行うことで、迅速に展開・使用できる軽量プラグインが実現します。
- トレーニングと損失関数の最適化:一貫性損失、人間からのフィードバック損失、および分留損失を組み合わせた損失関数を定義する。学生モデルは、勾配降下法などの最適化アルゴリズムを用いて学習され、同時にLoRAプラグインが更新される。
- 推論と画像生成:学習後、学生モデルは画像生成の推論プロセスに使用されます。生成品質と効率のバランスを取るために、アプリケーションシナリオのニーズに基づいて適切な推論ステップ数を選択してください。
- パフォーマンス評価:生成された画像の品質を評価するために、定量的指標(CLIPスコア、美的スコアなど)と定性的指標(ユーザー調査など)を使用します。評価結果に基づき、モデルパラメータをさらに調整・最適化した。