AB
AiBoss
project

SVDQuant - MITが開発した、拡散モデルの学習後量子化手法。

SVDQuantは、MITの研究チームによって開発された、学習後の量子化手法です。拡散モデルの場合、モデルの重みと活性化値を4ビットに量子化することで、メモリ使用量を削減し、推論処理を高速化します。SVDQuantは、高精度低ランク分岐吸収法を導入しています。

SVDQuantとは何ですか?

SVDQuantは、MITの研究チームが開発したトレーニング後の量子化技術です。拡散モデルの場合、モデルの重みと活性化値を4ビットに量子化することで、メモリ使用量を削減し、推論処理を高速化します。SVDQuantは、量子化中に外れ値を吸収する高精度の低ランクブランチを導入し、16GBの4090 GPU上で3.5倍のメモリ最適化と8.7倍のレイテンシ削減を実現しながら、画質を維持します。SVDQuantはDiTアーキテクチャをサポートし、UNetアーキテクチャと互換性があり、再量子化なしで市販の低ランクアダプタ(LoRA)とシームレスに統合できるため、リソース制約のあるデバイスに大規模な拡散モデルをデプロイするための効果的なソリューションを提供します。

SVDQuantの主な機能

  • 量子化圧縮拡散モデルの重みと活性化値は4ビットに量子化され、モデルのサイズとメモリ使用量が削減されます。
  • 推論を加速する量子化は計算の複雑さを軽減し、GPU上でのモデルの推論速度を向上させる。
  • 低ランクの分岐は外れ値を吸収する量子化における外れ値を処理する低ランク分岐を導入することで、量子化誤差を低減できる。
  • カーネル融合Nunchaku推論エンジンの設計は、カーネル融合に基づいており、メモリへのアクセスを削減し、推論効率をさらに向上させています。
  • 複数のアーキテクチャをサポートDiTおよびUNetアーキテクチャに対応した拡散モデル。
  • LoRA統合再量子化を必要とせずに、低ランクアダプタ(LoRA)をシームレスに統合します。

SVDQuantの技術原則

  • 定量化モデルの重みと活性化値に対して4ビット量子化を実行すると、モデルのパフォーマンスを維持する上で課題が生じる。
  • 外れ値の処理平滑化手法は、活性化値における外れ値を重みに反映させるために使用されます。重みは、特異値分解(SVD)に基づいて低ランク成分と残差に分解されます。
  • 低ランクの枝重みの外れ値を処理するため、16ビット精度の低ランク分岐を導入し、残差を4ビットに量子化し、量子化の難易度を低減します。
  • エッカート・ヤング・ミルスキーの定理重みから支配的な特異値を除去することで、重みの大きさと外れ値を大幅に削減します。
  • ヌンチャク推論エンジン推論エンジンは、低ランク分岐と低ビット分岐を統合したカーネルに基づいて設計されており、メモリアクセスとカーネル呼び出し回数を削減し、レイテンシを低減します。

SVDQuantのプロジェクトアドレス

SVDQuantの応用シナリオ

  • モバイルデバイスとエッジコンピューティングスマートフォン、タブレット、その他のモバイルデバイスに拡散モデルを展開することで、モデルサイズが縮小し、推論速度が向上するため、画像の生成と処理が高速化されます。
  • パーソナルコンピュータとワークステーションパーソナルコンピュータやワークステーションにおける画像・動画生成の効率を向上させ、コンテンツクリエイターやプロのデザイナーに最適です。
  • クラウドコンピューティングプラットフォームSVDQuantをクラウドサービスに導入することで、オンラインユーザーに仮想試着、画像編集、画像補正などの高速画像生成サービスを提供します。
  • インタラクティブなアプリケーションゲーム、仮想現実(VR)、拡張現実(AR)など、リアルタイムのフィードバックを必要とするアプリケーションでは、遅延を低減することで、よりスムーズなユーザーエクスペリエンスを実現できます。
  • 低消費電力デバイスIoT(モノのインターネット)デバイスやその他の低消費電力デバイスにおいて、よりエネルギー効率の高いモデル推論を可能にします。