AB
AiBoss
project

Delta-CoMe - 清華大学がOpenBMBおよび他の大学と共同でオープンソース化した、斬新な増分圧縮アルゴリズム。

Delta-CoMeは、清華大学NLP研究室がOpenBMBオープンソースコミュニティ、北京大学、上海財経大学と共同で提案した、新しい増分圧縮アルゴリズムです。80GBのA100 GPUは最大50個の7Bモデルを容易にロードでき、GPUメモリを節約します。

Delta-CoMeとは何ですか?

Delta-CoMe は、清華大学 NLP ラボが OpenBMB オープンソース コミュニティ、北京大学、上海財経大学と共同で提案した新しい増分圧縮アルゴリズムです。80GB の A100 GPU は、最大 50 個の 7B モデルを容易にロードでき、GPU メモリを約 8 分の 1 に節約しながら、圧縮前のファインチューニングされたモデルとほぼ同じモデル性能を維持します。Delta-CoMe は、低ランク分解と低ビット量子化技術を組み合わせ、モデル パラメータ増分 (Delta) の低ランク特性を利用して混合精度圧縮を実現します。この方法は、ストレージと推論コストを大幅に削減しながら、モデル性能をほとんど損なうことなく、数学、コーディング、マルチモーダル タスクなどの複雑なタスクの処理において非常に優れた性能を発揮します。

Delta-CoMeの主な機能

  • モデル圧縮混合精度圧縮技術に基づき、大規模言語モデル(LLM)のストレージとメモリ要件を大幅に削減し、限られたハードウェアリソース上でより多くのモデルを展開することを可能にする。
  • パフォーマンス維持目標は、特に数学的問題解決、コード生成、マルチモーダルタスクなどの複雑なタスクにおいて、圧縮しながらもモデルのパフォーマンスを維持することであり、圧縮されたモデルのパフォーマンスが、圧縮されていないファインチューニングされたモデルのパフォーマンスに近くなるようにすることです。
  • マルチタスク異なる機能を持つ複数のモデルの同時展開をサポートしているため、マルチテナントおよびマルチタスク処理シナリオに適しており、モデル展開の柔軟性と効率性を向上させます。
  • 推論速度の向上Tritonカーネル演算子の実装に基づき、推論速度はPyTorch実装と比較して約3倍向上し、モデルの実行効率がさらに最適化されました。

Delta-CoMeの技術原理

  • 低ランク分解特異値分解(SVD)を用いてモデルパラメータ増分(デルタ)の低ランク分解を行ったところ、デルタパラメータは低ランク特性を持ち、変化の大部分が少数の主成分に集中していることがわかった。
  • ハイブリッド精密量子化低ランク分解の結果に基づき、混合精度量子化法を採用して、異なる特異ベクトルに異なるビット幅を割り当てます。特異値が大きい特異ベクトルは高精度で表現され、特異値が小さい特異ベクトルは低精度で表現されるため、記憶容量の要件が軽減されます。
  • ロングテール分布の利用Delta-CoMeは、Deltaパラメータの特異値が裾の長い分布を示すことを観察しています。つまり、ほとんどの特異値は小さく、大きい特異値はごくわずかです。そのため、小さい特異値に対応する特異ベクトルにはより積極的な圧縮が適用され、大きい特異値に対応する特異ベクトルにはより高い精度が維持されます。
  • 互換性と汎用性Delta-CoMe法は、特定のモデルやタスクに適しており、優れた汎化能力を備えています。Llama-2、Llama-3、Mistralなどの様々なバックボーンモデルに対応し、多様なタスクにおいて良好なパフォーマンスを維持します。
  • ハードウェア最適化推論速度をさらに向上させるため、Delta-CoMeは混合精度量子化用のTritonカーネル演算子を実装し、ハードウェアの展開効率を高めています。

Delta-CoMeプロジェクトの住所

Delta-CoMeの応用シナリオ

  • マルチテナントサービスクラウドコンピューティング環境において、限られたハードウェアリソース上で顧客ごとに専用モデルを提供することをサポートし、ビデオメモリとコンピューティングリソースの節約を実現します。
  • マルチタスク複数の異なるタスクを同時に処理する必要があるシナリオでは、異なるタスク用のモデルを効果的に圧縮して展開することができる。
  • エンドサイド展開リソース制約のあるエッジコンピューティングデバイス上で、モデルのストレージとメモリ使用量を削減する。
  • モデル微調整サービス新しいデータやタスクに適応するために頻繁な微調整が必要なモデルの場合、微調整されたモデルの増分を圧縮して、ストレージと推論のコストを削減します。
  • 学術研究開発研究者や開発者は、ハードウェアリソースの制約を受けることなく、大規模な言語モデルを圧縮して展開し、実験や開発に活用できる。