project
MHA2MLA - 復旦大学、上海AI研究所などが、LLM推論効率を最適化する手法を公開。
MHA2MLAは、復旦大学、華東師範大学、上海AI研究所などが共同開発した、データ効率の高い微調整手法です。DeepSeekのマルチヘッド潜在アテンション(MLA)メカニズムを組み込むことで、あらゆるTransformerベースのアルゴリズムを最適化します。
MHA2MLAとは何ですか?
MHA2MLAは、復旦大学、華東師範大学、上海AI研究所などが共同開発した、データ効率の高い微調整手法です。これは、以下の導入に基づいています。DeepSeekマルチヘッド潜在アテンション(MLA)メカニズムは、TransformerベースのLLMの推論効率を最適化し、推論コストを削減します。MHA2MLAは、2つの主要な戦略に基づいて実装されています。1つ目は、アテンションスコアにほとんど寄与しないクエリとキーの回転位置エンコーディング(RoPE)次元を削除する部分RoPE、2つ目は、KVキャッシュのメモリフットプリントを削減するために、ジョイント特異値分解(SVD)に基づいてキーと値を圧縮する低ランク近似です。MHA2MLAは、微調整に元のデータのわずか0.3%から0.6%しか必要としないため、KVキャッシュを大幅に削減(例えば92.19%)しながら、パフォーマンスの低下を極めて小さく抑えます(例えば、LongBenchパフォーマンスの低下はわずか0.5%)。
MHA2MLAの主な機能
- KVキャッシュを大幅に削減低ランク圧縮技術に基づき、KVキャッシュのサイズが大幅に削減され(最大96.87%)、推論時のメモリ使用量が削減されます。
- モデルのパフォーマンスを維持する極めて少量のデータ(元のトレーニングデータの0.3%~0.6%)で微調整を行うことで、パフォーマンスの低下を非常に小さな範囲に抑えることができます(例えば、LongBenchのパフォーマンスはわずか0.5%しか低下しません)。
- 既存の技術と互換性があります量子化技術(例えば4ビット量子化)と併用することで、推論効率をさらに向上させることができる。
- データ効率MHAからMLAへのアーキテクチャ変換は少量のデータで完了できるため、リソースが限られた環境での迅速な導入に適しています。
MHA2MLAの技術原理
- 部分RoPE(部分回転位置符号化)MHAでは、回転位置符号化(RoPE)が回転操作に基づいてクエリベクトル(Q)とキーベクトル(K)に位置情報を組み込み、モデルがシーケンス内の位置関係を捉えるのに役立ちます。各次元のアテンションスコアへの寄与度に基づいて、寄与度の小さいRoPE次元(つまり「重要でない」次元)が削除され、計算量とメモリ使用量が削減されます。このプロセスは「部分RoPE」と呼ばれ、重要な位置情報を保持しながら、低ランク圧縮のためのスペースを確保します。
- 低ランク近似MHA2MLAは、キーと値の行列(KV行列)の低ランク同時圧縮を用いることでメモリ使用量を削減します。この考え方に基づき、MHA2MLAはMHA内のキーと値のパラメータ行列に対して特異値分解(SVD)を実行します。これにより、キーと値の行列は低ランク行列の積に分解され、より少ないパラメータで元の行列を近似します。キーと値の間の相互作用情報をより適切に保持するために、MHA2MLAはキーと値の行列を個別に処理するのではなく、同時分解を実行する共同SVD戦略を採用しています。
MHA2MLAプロジェクトの住所
- GitHubリポジトリ:https://github.com/JT-Ushio/MHA2MLA
- arXiv技術論文:https://arxiv.org/pdf/2502.14837
MHA2MLAの応用シナリオ
- エッジデバイスの展開モデルのメモリ使用量を削減することで、リソースに制約のあるスマート端末やIoTデバイスとの互換性を確保する。
- 大規模モデル推論キーバリューキャッシュを削減し、推論効率を向上させ、ハードウェアコストとエネルギー消費量を削減する。
- 定量的手法を組み合わせる量子化技術と組み合わせることで、推論性能がさらに最適化され、リアルタイム対話やオンライン翻訳などのシナリオに適しています。
- 長文処理長文処理におけるメモリのボトルネックを軽減し、長文文書の要約を効率的に処理し、長文記事を生成します。
- 迅速なモデル転送微調整に必要なデータ量が少量であれば、MHAモデルをMLAアーキテクチャに迅速に変換できるため、移行コストを削減できます。