project
IndexCache - 清華大学とZhipuが共同開発した、スパースアテンション高速化技術。
IndexCacheは、清華大学とZhipuチームが開発したスパースアテンション高速化技術です。クロスレイヤーインデックスの再利用によって冗長な計算を削減することで、DeepSeek Sparse Attention(DSA)におけるインデクサの計算オーバーヘッドが高いという問題を解決します。
IndexCacheとは何ですか?
IndexCacheは、清華大学とZhipuチームが開発したスパースアテンション高速化技術です。DeepSeek Sparse Attention(DSA)におけるインデクサーの高い計算オーバーヘッドに対処するため、レイヤー間でインデックスを再利用することで冗長な計算を削減します。IndexCacheは、隣接するレイヤーによって選択された上位kトークンの重複率が70%~100%にも達することを発見し、レイヤーを「フルレイヤー」(インデックスの計算とキャッシュ)と「共有レイヤー」(キャッシュを直接再利用)に分割しました。この手法により、インデクサーの計算を75%削減でき、20万コンテキストのシナリオにおいて、モデルのパフォーマンスをほとんど損なうことなく、プリフィルで1.82倍、デコードで1.48倍の高速化を実現しました。その有効性は、300億パラメータのモデルと7440億パラメータのGLM-5モデルで検証されています。
IndexCacheの主な機能
- クロスレベルインデックスの再利用: 重複率が 70%~100% と高い隣接レイヤーの上位 k 個のインデックスを使用することで、共有レイヤーがフルレイヤーのキャッシュされたインデックスを直接再利用できるようになり、冗長な計算を回避できます。
- インデクサのオーバーヘッドを大幅に削減これにより、インデクサーの計算処理を75%削減し、モデルのパフォーマンスを維持するためにインデクサーの1/4だけを残すことができます。
- 推論を大幅に加速する200Kのコンテキストにおいて、プリフィル処理で1.82倍、デコード処理で1.48倍の高速化を実現し、ユーザーの待ち時間を短縮します。
- メモリオーバーヘッドはゼロ再利用は条件分岐によって実現され、追加のGPUメモリを割り当てる必要はありません。
- 2つの導入オプションが用意されています。トレーニングなしの方式では、貪欲探索によって最適な層パターンを決定する一方、トレーニングを考慮した方式では、多層蒸留損失によってインデクサのパラメータを最適化する。
- 生産レベルの検証30パラメータモデルと744パラメータのGLM-5で検証済みであり、SGLangおよびvLLM推論フレームワークをサポートしています。
IndexCacheの技術的原理
- クロスレベルインデックス類似性発見研究チームはヒートマップ分析を通して、DSAモデルの隣接する層のインデクサーが出力する上位k個のトークンセットが非常に高い類似性を示し、重複率が一般的に70%から100%の間であることを発見した。これは、インデックス作成計算の大部分が冗長であることを示している。
- 階層型役割分担メカニズムIndexCacheはモデル層を2つのカテゴリに分割します。Full Layerは元のインデクサーを保持し、最新のトップkインデックスの計算とキャッシュを担当します。Shared Layerは独自のインデクサーを実行せず、最新のFull Layerによってキャッシュされたインデックスを直接再利用してスパースアテンションの計算を行います。
- 動的モード選択戦略学習済みモデルの場合、キャリブレーションデータに基づく貪欲探索アルゴリズムを用いて、各層を共有層に変換し、モデル出力への影響を評価すると同時に、重要な層は完全な層として保持します。ゼロから学習を行う場合は、多層蒸留損失を導入し、各完全層インデクサが複数の後続の共有層のニーズに同時に対応できるように学習できるようにします。
- 推論プロセスの最適化推論処理中、各層は単純な条件判定を追加するだけで、あらかじめ設定されたモードに従って新しいインデックスの計算とキャッシュされたインデックスの再利用を切り替えることで、モデルアーキテクチャを変更したり、追加のストレージを追加したりすることなく、インデクサの層間共有を実現します。
IndexCacheの重要な情報と使用要件
- 提案組織清華大学とZ.aiが共同開発しました。
- 問題への対応としてこれは、DeepSeekのスパースアテンションシナリオにおいて、長いコンテキストを持つインデクサーの計算上のボトルネックに対処するもので、20万トークンを扱う場合、事前充填時間の最大81%を占める問題を解決します。
- 基本原則隣接する層のトップkインデックスの重複率が70%~100%と高いことに基づき、レイヤー間でインデックスを再利用することで冗長な計算を削減します。
- 加速効果インデクサの1/4を保持することで、プリフィル処理の速度が1.82倍、デコード処理の速度が1.48倍向上します。
- パフォーマンスの低下品質の低下はほとんどなく、一部の推論タスクではむしろパフォーマンスが向上した。
- 検証モデル結果は、30BパラメータDSAモデルと744BパラメータGLM-5モデルの両方で検証された。
- ハードウェア要件NVIDIA製GPU(H100など)が必要ですが、追加のビデオメモリは不要です。標準のDSAメモリ空間を再利用します。
- ソフトウェア環境SGLangまたはvLLMフレームワークをサポートし、DeepSeek-V3.2、GLM-5、およびその他のモデルで直接使用できる既製のパッチを提供します。
- 研修プログラムなしこの方法は、事前学習済みのDSAモデルに適用可能で、最適なレイヤーモードを決定するために、少量のキャリブレーションデータを用いて貪欲探索を実行する必要があります。
IndexCacheの主な利点
-
著しい加速200Kコンテキストにおいて、プリフィル処理が1.82倍、デコード処理が1.48倍高速化され、ユーザーの待ち時間を大幅に短縮します。
-
パフォーマンスの低下はゼロインデクサの計算処理を75%削減した後も、モデルの品質はほとんど影響を受けず、一部のタスクではわずかに向上する結果となった。
-
追加のオーバーヘッドはゼロ条件分岐は、GPUメモリの使用量を増やすことなく再利用でき、標準DSAによって既に割り当てられたメモリを再利用できます。
-
プラグアンドプレイSGLangおよびvLLM用のパッチを提供し、モデルアーキテクチャを変更することなく、DeepSeek-V3.2やGLM-5などの主流モデルに直接適用できます。
-
柔軟な導入トレーニングなしのアプローチとトレーニングを考慮したアプローチの両方をサポートし、トレーニング済みモデルと新規トレーニングシナリオの両方に対応し、インデクサー保持率を柔軟に設定できます。
-
生産レベルの検証744Bパラメータを用いたGLM-5大型モデルにおいて有効性が検証されており、大規模展開にも対応可能である。
IndexCacheのプロジェクトアドレス
- GitHubリポジトリ:https://github.com/THUDM/IndexCache
- arXiv技術論文:https://arxiv.org/pdf/2603.12201
IndexCacheと類似の競合製品との比較
| 比較対象寸法 | IndexCache | ネイティブDSA | 集中アンカー法 |
|---|---|---|---|
| コアメカニズム | クロスレイヤーインデクサの再利用によって出力される上位k個のインデックス | 各層はそれぞれ独立して軽量インデクサを実行する。 | フルアテンションアンカーレイヤーに基づく再利用インデックス |
| 計算オーバーヘッド | インデクサの75%を削減すると、事前充填の速度が1.82倍向上します。 | 20万件のデータの場合、インデクサーがプリフィル時間の81%を占めます。 | 注意機構全体を保持する必要があり、そのためには高い計算コストがかかる。 |
| 適用可能なシナリオ | 完全な注意を排除するDSAアーキテクチャ | 標準DSA展開 | アンカーポイントとして十分な注意を必要とする建築 |
| 実装の複雑さ | if/else分岐が1つ、追加のビデオメモリはゼロ | 標準実装 | アンカー層戦略を策定する必要がある。 |
| トレーニング要件 | トレーニング不要の展開、またはトレーニングを考慮した最適化をサポートします。 | 必要な研修を修了してください。 | 合同訓練は通常必要となる。 |
| 生産検証 | 744B GLM-5 検証 | DeepSeek-V3の実用アプリケーション | 主に小規模から中規模の実験 |
IndexCache の適用シナリオ
-
長文文書処理学術論文の読解や法的契約の分析といったシナリオに適しており、20万件のコンテキストにおいて事前入力速度を1.82倍に向上させ、ユーザーが最初のトークンを取得するまでの待ち時間を大幅に短縮します。
-
複数ステップの推論タスク数学的証明やコード生成といった複雑な論理連鎖推論をサポートし、デコード速度が1.48倍向上することで、思考連鎖の生成プロセスを加速します。
-
エージェントのワークフローこれにより、複数回のツール呼び出し、自律的なタスク計画、その他のエージェント処理が可能になり、長時間のコンテキスト推論のコストが削減され、より複雑なエージェント間の相互作用がサポートされます。
-
RAGシステム大規模な知識ベース検索の生成を強化し、長文のコンテキスト統合を効率的に処理し、ウェブ規模の検索結果を生成するために使用されます。
-
リアルタイム対話サービスこれは、顧客サービスロボットやインテリジェントアシスタントなどのオンラインサービスに適しており、処理能力の向上、サービスコストの削減、エンドユーザーエクスペリエンスの向上に貢献します。