project
Gemma 3 QAT - Googleの最新のオープンソースモデルであり、Gemma 3の量子化バージョンです。
Gemma 3 QAT(Quantization-Aware Training)は、Googleの最新のオープンソースモデルであり、Gemma 3の量子化最適化バージョンです。量子化対応トレーニング技術により、Gemma 3 QATはメモリ使用量を大幅に削減します。
Gemma 3 QATとは何ですか?
Gemma 3 QAT(Quantization-Aware Training)は、Googleの最新世代のオープンソースモデルであり、Gemma 3の量子化最適化バージョンです。量子化対応トレーニング技術により、Gemma 3 QATはメモリ要件を大幅に削減しながら、高品質なパフォーマンスを維持します。Gemma 3 27BのVRAM要件は54GBから14.1GBに削減され、NVIDIA RTX 3090などの一般消費者向けGPUでネイティブに動作できるようになりました。Gemma 3 12BのVRAM要件は24GBから6.6GBに削減され、NVIDIA RTX 4060 GPUを搭載したノートPCで効率的に動作できるようになりました。これにより、より多くのユーザーが一般的なハードウェアで強力なAI機能を体験できるようになります。
Gemma 3 QATの主な機能
- ビデオメモリの必要量を大幅に削減量子化を考慮したトレーニング技術を用いることで、Gemma 3 QATはモデルのGPUメモリ使用量を大幅に削減します。
- Gemma 3 27Bビデオメモリの必要容量が54GB(BF16)から14.1GB(int4)に削減されたことで、NVIDIA RTX 3090(24GB VRAM)などの一般消費者向けGPUでも動作可能になった。
- Gemma 3 12Bビデオメモリの必要容量が24GB(BF16)から6.6GB(int4)に削減されたため、ノートパソコンのNVIDIA RTX 4060(8GB VRAM)でも効率的に動作することが可能になった。
- 小型版(4B、1B)携帯電話のようなリソースが限られたデバイスでも動作可能です。
- 高いパフォーマンスを維持するGemma 3 QATは、ネイティブのBF16モデルと同等のパフォーマンスを維持しています。Chatbot ArenaのEloスコアでは、量子化されたGemma 3 QATは依然として競争力があり、トップクラスの言語モデルと遜色ないパフォーマンスを発揮しています。GoogleはQAT技術を使用することで、約5000回のトレーニングステップでパープレキシティを54%削減し、量子化後もモデルの高い精度を維持できるようにしました。
- マルチモーダル機能画像入力とテキスト生成に対応しているため、視覚的質問応答(VQA)や文書分析などのタスクに適しています。
- 長文コンテキストのサポート128,000個のトークンを含むコンテキストウィンドウを備え、ハイブリッドアテンションメカニズム(ローカルスライディングウィンドウアテンションとグローバルアテンション)によって最適化されており、キーバリューキャッシュのメモリ使用量を削減します。
- ハードウェアサポートGemma 3 QATは、デスクトップGPU、ノートPC用GPU、エッジデバイスなど、さまざまな消費者向けハードウェア上で動作します。
- フレームワークのサポートOllama、LM Studio、llama.cpp、MLXといった主要な推論フレームワークをサポートしているため、ユーザーは様々なプラットフォームに容易に展開できます。
Gemma 3 QATの技術的原則
- 擬似定量的演算トレーニングの順伝播中、モデルは「擬似量子化」ノードを介して低精度の計算をシミュレートし、重みと活性化値を量子化された値に丸めます。
- 高精度逆伝播逆伝播の過程でも、モデルは高精度の浮動小数点数を使用して勾配を計算し、重み更新の精度を確保します。
- トレーニングと定量化を組み合わせるこのようにして、モデルはトレーニング段階で低精度環境下でも性能を維持する方法を学習し、実際の量子化後の精度低下は最小限に抑えられる。
- KVキャッシングの最適化スパースキャッシングと動的圧縮技術を用いることで、長コンテキストタスクにおけるメモリ使用量をさらに削減できる。
- ハードウェアアクセラレーションAVX512やNEONなどのSIMD命令セット最適化をサポートし、推論処理を3倍高速化します。
Gemma 3 QATのプロジェクトアドレス
- プロジェクト公式サイト:Gemma 3 QAT
- ハギングフェイスモデルライブラリ:https://huggingface.co/collections/google/gemma-3-qat
Gemma 3 QATの適用シナリオ
- 視覚的質問応答(VQA)Gemma 3 QATはマルチモーダルタスクで優れた性能を発揮し、量子化バージョンはDocVQAなどのタスクでFP16に近い性能を発揮します。
- 文書分析128Kトークンという長いコンテキストウィンドウをサポートしているため、文書分析など、大量のテキストを処理する必要のあるタスクに適しています。
- 長文生成Gemma 3 QATは、KVキャッシングの最適化とGrouped Query Attention(GQA)により、128Kコンテキストウィンドウにおいてメモリ使用量を40%削減し、推論速度を1.8倍向上させます。
- 長系列推論長文文書の解析や複雑な言語モデル推論など、長いシーケンスの処理を必要とするタスクに適しています。
- エッジデバイスの展開Gemma 3 QATの1Bバージョン(529MB)は、AndroidまたはWeb上でオフラインで動作し、レイテンシは10msと非常に低いため、プライバシーが重視されるシナリオ(医療や金融など)に適しています。