project
TurboQuant - Googleのベクトル量子化アルゴリズム
TurboQuantは、Google Researchが開発したベクトル量子化アルゴリズムで、大規模モデルのKVキャッシュを32ビットから3ビットに圧縮することができ、メモリ使用量を6分の1に削減し、推論速度を8倍に向上させ、精度を一切損なうことなく実現します。
TurboQuantとは何ですか?
Google Researchが開発したベクトル量子化アルゴリズムであるTurboQuantは、大規模なモデルのキーバリューキャッシュを32ビットから3ビットに圧縮することで、メモリ使用量を6分の1に削減し、推論速度を8倍向上させ、精度を一切損なうことなく処理できます。TurboQuantは、ランダム回転と1ビットQJL残差補正を組み合わせることで、ベクトルをベータ分布に従う座標系に変換します。これにより、キャリブレーション定数やモデルの微調整が不要になり、プラグアンドプレイで利用できます。TurboQuantは、GemmaやMistralなどのモデルにおけるロングコンテキストタスクをサポートすることが検証されており、エッジデバイスへの展開やクラウド推論コストの削減において重要なブレークスルーとなります。
TurboQuantの主な機能
-
極度の圧縮32ビット浮動小数点KVキャッシュを3ビットに圧縮することで、メモリ使用量を6倍以上削減するとともに、最小1ビットの超圧縮モードもサポートします。
-
推論を加速する高度にベクトル化された量子化計算により、H100 GPU上でのアテンション計算速度が8倍に向上し、推論レイテンシが大幅に削減されます。
-
精密メンテナンスLongBenchやNeedle in a Haystackといった長コンテキストベンチマークテストでは、圧縮モデルは元のモデルと全く同じスコアを記録し、真の精度損失ゼロを達成しました。
-
プラグアンドプレイデータに依存しないオンライン量子化戦略を採用しているため、特定のデータセットに対するモデルの再トレーニング、微調整、またはキャリブレーションが不要となり、導入のハードルが低くなっています。
-
デュアルモード量子化本システムは、再構成誤差を最小化するMSE最適化モードと、偏りのないアテンションスコア推定を提供する内積最適化モードを備えており、さまざまなアプリケーションシナリオのニーズに対応します。
-
複数のシナリオに適用可能これは、大規模モデルのKVキャッシュ圧縮に適しており、超長コンテキストとベクトルデータベースの最近傍検索をサポートし、再現率とインデックス作成速度の両方で従来の手法を凌駕します。
TurboQuantの技術原理
-
ランダム回転による次元削減入力ベクトルにランダム回転行列を適用することで、高次元ベクトルはデカルト座標系から、各座標がベータ分布に従う空間へと変換され、異なる座標がほぼ独立になります。これにより、各座標に最適なスカラー量子化を独立して適用することが可能になり、データに依存する較正定数を保存する必要がなくなります。
-
最適なスカラー量子化ベータ分布の統計的特性に基づき、ロイド・マックスアルゴリズムを用いて連続一次元k平均法問題を解く。各座標について最適な量子化コードブックを事前に計算し、ほぼ最適なMSE歪み率を実現する。
-
2段階残差補正MSE最適量子化器を一次圧縮に適用し、その後、残差ベクトルに1ビット量子化ジョンソン・リンデンシュトラウス変換を適用して補正を行い、内積推定におけるバイアスを除去し、バイアスのない低歪みの注意計算を実現します。
-
情報理論最適保証TurboQuantの歪み率がシャノンの理論上の下限値から定数係数の約2.7倍しか異ならず、低ビット深度では最適値に近いことを証明することで、このアルゴリズムの限界性能が理論的に検証される。
TurboQuantの重要な情報と使用要件
-
出版社この論文は、Google ResearchとGoogle DeepMindの共同研究によるもので、ICLR 2026で発表されました。
-
主要指標KVキャッシュは3ビットに圧縮され、メモリ使用量を6分の1に削減し、推論速度を8倍に向上させ、精度を一切損なうことなく実現します。
-
技術の組み合わせこれは、PolarQuant(ランダム回転+ベータ分布量子化)とQJL(1ビット残差補正)の2つの段階から構成されます。
-
理論上の保証歪み率は情報理論の下限値の2.7倍以下であり、1ビットの場合の下限値のわずか1.45倍である。
-
検証モデルGemmaやMistralといった大規模なオープンソースモデルは、LongBenchやNeedle in a Haystackを含む5つの長期コンテキストベンチマークテストに合格した。
-
コミュニティ実現PyTorch、MLX、C/CUDAなど、複数のサードパーティ製実装が登場している。
-
研修は不要ですモデルの再学習や微調整は不要で、事前学習済みのモデルに直接適用できます。
-
校正は不要ですデータに依存しないオンライン量子化戦略を採用しているため、特定のデータセットに対するオフラインでのキャリブレーションや前処理が不要となる。
-
ハードウェアサポート最適なパフォーマンスを実現するには、ベクトル処理に対応したAIアクセラレータ(GPUなど)が必要ですが、アルゴリズム自体は特定のハードウェアに依存しません。
TurboQuantの主な利点
-
極限圧縮比32ビットのKVキャッシュを3ビットに圧縮することで、メモリ使用量を6倍以上削減でき、最小1ビットの極限圧縮にも対応できるため、長時間のコンテキストシナリオにおけるメモリボトルネックを大幅に緩和できます。
-
精度損失ゼロ5つの長文コンテキストベンチマークテストにおいて、圧縮モデルは元のモデルと全く同じスコアを記録し、ほぼロスレス圧縮ではなく、真のロスレス圧縮を達成した。
-
推論速度が大幅に向上する高度にベクトル化されたアルゴリズム設計により、アテンション計算の速度が8倍向上し、推論遅延が効果的に削減され、スループットが向上します。
-
プラグアンドプレイによる導入モデルの再学習、微調整、データ較正は一切不要です。すぐに使用できるため、エンジニアリング実装の障壁と展開コストを大幅に削減できます。
-
理論上の最適性能歪み率はシャノンの下限値から定数係数の約2.7倍しか異ならず、ビット深度が低いほどその差はさらに小さくなり、理論上の限界値に近づく。
TurboQuantの使い方
公式のオープンソースコードはまだ公開されていません。最新のオープンソース情報については、Google Researchの公式リポジトリまたはarXivの論文ページをご覧ください。
TurboQuantのプロジェクトアドレス
- プロジェクト公式サイト:https://research.google/blog/turboquant-redefining-ai-efficiency-with-extreme-compression/
- arXiv技術論文:https://arxiv.org/pdf/2504.19874
TurboQuantの類似製品の比較
| 比較対象寸法 | TurboQuant | H2O | GPTQ |
|---|---|---|---|
| テクニカルルート | ベクトル量子化(3ビット圧縮) | ヘビーヒッターのスパース性保存 | 静的重み付け量子化(4ビット) |
| 圧縮オブジェクト | KVキャッシュ(アクティベーション値) | KVキャッシュ(選択的破棄) | モデルの重み |
| 圧縮比 | 6倍(32ビット→3ビット) | 構成にもよりますが、およそ2~4倍です。 | 4倍(重量) |
| 精度低下 | 損失ゼロ(ベンチマークテストと一致) | 軽微な損失 | 軽微な損失 |
| 研修は必要ですか? | いいえ | いいえ | いいえ |
| 校正は必要ですか? | いいえ、そのデータは関係ありません。 | いいえ | はい、データセットの較正が必要です。 |
| 動的な入力に対応していますか? | はい、オンライン定量分析 | はい | いいえ、オフライン量子化 |
| 加速効果 | 8回(注目度に基づいて算出) | 限定 | 制限あり、主にビデオメモリの節約 |
TurboQuantの応用事例
-
ロングコンテキストLLMサービスKVキャッシュを6分の1に圧縮することで、クラウドAPIは数百万ものトークンコンテキストをサポートできるようになり、計算コストを大幅に削減し、並行処理能力を向上させることができます。
-
コンシューマー向けグラフィックカードの展開これにより、32GBのビデオメモリを搭載したコンシューマー向けGPUで、7B以上のモデルを用いた長時間のコンテキストタスクをスムーズに実行できるようになり、ローカル展開システムのビデオメモリのボトルネックを解消します。
-
エッジデバイス推論これは、携帯電話やIoTデバイスなど、メモリ容量に制約のあるシナリオ向けに圧縮ソリューションを提供し、大規模モデルの機能をエッジデバイスに展開することを可能にします。
-
ベクターデータベース検索これは従来のプロダクト量子化に代わるもので、RAGシステムにおいて、より高い再現率とより低いインデックス作成遅延でセマンティック検索を可能にします。