project
KTransformers - 清華大学が開発した、大規模言語モデル推論を最適化するためのオープンソースフレームワーク
KTransformersは、清華大学のKVCache.AIチームが曲靖科技と共同で立ち上げたオープンソースプロジェクトです。大規模言語モデルの推論性能を最適化し、ハードウェア要件を低減します。KTransformersは、GPU/CPUヘテロジニアスコンピューティング戦略に基づいており、…
KTransformersとは何ですか?
KTransformersは、清華大学のKVCache.AIチームが曲靖科技と共同で立ち上げたオープンソースプロジェクトです。大規模言語モデルの推論性能を最適化し、ハードウェア要件を低減します。GPU/CPUヘテロジニアスコンピューティング戦略に基づき、MoEアーキテクチャのスパース性を活用することで、KTransformersは、VRAMがわずか24GBの単一GPU上でDeepSeek-R1およびV3(671Bフルパワーバージョン)の実行をサポートします。前処理速度は最大286トークン/秒、推論生成速度は最大14トークン/秒に達します。このプロジェクトは、計算負荷の高いオフロード戦略、高性能演算子、およびCUDAグラフ最適化により、推論速度を大幅に向上させます。
KTransformersの主な機能
- 非常に大規模なモデルのローカル推論のサポート従来のハードウェアの制約を打ち破り、わずか24GBのビデオメモリを搭載した単一のグラフィックカード上で、DeepSeek-R1のような671Bパラメータを持つフルパワーの大規模モデルを実行することを可能にします。
- 推論速度を向上させる前処理速度は最大286トークン/秒、推論生成速度は最大14トークン/秒に達する。
- 複数のモデルおよびオペレーターに対応DeepSeekシリーズおよびその他のMoEアーキテクチャモデルをサポートし、柔軟なテンプレート注入フレームワークを提供し、ユーザーが量子化戦略やカーネル置換を切り替えることをサポートし、さまざまな最適化ニーズに対応します。
- ハードウェアのしきい値を下げるこれにより、大規模モデルのメモリ要件が大幅に削減され、一般ユーザーや中小規模のチームが、数千億個のパラメータを持つモデルを一般消費者向けハードウェア上で実行できるようになり、「家庭のような」環境での運用が可能になります。
- 長シーケンスタスクをサポートするIntel AMX命令セットを統合することで、CPUのプリフィル速度は286トークン/秒に達し、従来のソリューションよりも28倍高速になり、長いシーケンスタスクの処理時間を「数分」から「数秒」に短縮します。
KTransformersの技術原理
- 教育省建築疎行列のMoE行列はCPU/DRAMにオフロードされて処理され、密行列部分はGPUに保持されるため、ビデオメモリの要求が大幅に削減されます。
- オフロード戦略タスクは計算負荷に基づいてGPUとCPUに割り当てられます。高負荷のタスク(MLA演算子など)は優先的にGPUに割り当てられ、低負荷のタスクはCPUに割り当てられます。
- 高性能演算子最適化:
- CPU側:llamafileをCPUコアとして使用し、マルチスレッド、タスクスケジューリング、負荷分散などの最適化を組み合わせることで、CPUの推論効率が向上します。
- GPU側では、量子化行列の計算を最適化するためにMarlin演算子が導入され、従来のライブラリ(Torchなど)と比較して3.87倍の高速化を実現しています。
- CUDAグラフ最適化CUDA Graphを活用することで、Python呼び出しのオーバーヘッドが削減され、CPU/GPU間の通信ブレークポイントが最小限に抑えられ、効率的な異種コンピューティング連携が可能になります。各デコード操作に必要なCUDA Graph呼び出しは1回のみで済むため、推論パフォーマンスが大幅に向上します。
- 量子化とストレージの最適化4ビット量子化技術を採用することで、モデルのストレージ要件がさらに削減され、671Bパラメータモデルを実行するために必要なビデオメモリはわずか24GBで済みます。同時に、ストレージオーバーヘッドを削減するためにKVキャッシュサイズも最適化されています。
- テンプレートインジェクションフレームワークYAMLベースのテンプレート注入フレームワークを提供することで、ユーザーは量子化戦略、カーネル置換、その他の最適化手法を柔軟に切り替え、さまざまなシナリオのニーズに適応させることができます。
KTransformersプロジェクトの住所
- GitHubリポジトリ:https://github.com/kvcache-ai/ktransformers
KTransformersの応用事例
- 個人の能力開発と中小規模のチーム大規模なモデルを一般消費者向けハードウェアで実行することで、テキスト生成システムや質問応答システムなどを開発し、コストを削減できます。
- 長シーケンスタスク長文を効率的に処理し、コード分析を実行することで、処理時間を数分から数秒に短縮します。
- エンタープライズアプリケーション大規模モデルは、インテリジェントな顧客サービスやコンテンツ推薦などにローカルで展開できるため、クラウドサービスのコストを削減できます。
- 学術研究一般的なハードウェア上でMoEアーキテクチャモデルを探索・最適化することで、研究プロセスを加速させる。
- 教育と訓練教育ツールとして、学生が大規模モデルの応用を練習し、最適化手法を理解するのに役立ちます。