Glyd - 把 bf16 权重与 KV 缓存无损压进更少显存的推理加速工具
Glyd 是一个面向大模型推理的无损压缩项目:它把 bf16 模型的权重和 KV 缓存以更少的比特保存在 GPU 显存中,在模型运行时还原出精确的原始数值。项目自述称,同一模型大约只需三分之二的显存,从而能塞进更小的 GPU,或在同一张卡上服务更多请求。除 GPU 侧组件外,它还包含一个 Rust 编写的通用无损压缩库与命令行工具。
Glyd 是一个围绕大模型推理显存占用做文章的开源项目。按项目自述,它的做法是把 bf16 模型的权重和 KV 缓存以更少的比特保存在 GPU 显存里,并在模型运行时重建出精确的原始数值——也就是「无损」压缩,而不是常见的量化近似。它想解决的问题很直接:显存是部署大模型时最紧的约束,权重占掉的部分如果能压下来,腾出的空间就能变成 KV 缓存,从而让模型装进更小的 GPU,或者在同样的硬件上同时处理更多请求。它适合需要在有限 GPU 资源上部署或服务模型的工程团队,也适合对压缩编解码本身感兴趣、想拿它替代 LZ4、Snappy、zstd 的开发者。
维护者与状态
项目由 surya-koritala 维护,仓库创建于 2026-09-19,最后一次提交在 2026-10-05。最新 release 为 v0.28.0,发布于 2026-10-05。截至 2026-10-05,仓库星标数为 246。许可证为 BSD-3-Clause。
主要能力
以下能力均来自项目自述,未经本站实测验证。
- 显存无损压缩:据项目说明,Glyd 把 bf16 模型的权重与 KV 缓存以更少比特存放在 GPU 显存中,运行时重建精确数值。README 中称,每一个权重、KV 缓存中的每一个 key 和 value,读回时都是精确的 bf16 值。
- 输出差异的边界:项目自述明确指出,由于 Glyd 的 kernel 以不同顺序累加相同的乘积(任何两个 GPU kernel 之间都会如此),输出仍可能与 bf16 在最低几位上不同;设置
exact=True可以得到与 bf16 完全一致的 logits。 - 命令行直接运行:README 给出的方式是先执行安装脚本,再用
glyd run Qwen/Qwen3-8B,由它根据你的 GPU 给出设置,然后在终端里开始对话。 - vLLM 集成:项目说明称可以通过
pip install "glyd[vllm]"安装,并在启动 vLLM 时加上--quantization glyd参数。 - Python 调用:README 中给出的用法是
import glyd后调用glyd.from_pretrained("Qwen/Qwen3-8B")。 - 通用压缩库与 CLI:据项目自述,GPU 工作之下,Glyd 还是一个用 Rust 编写、带 C ABI 的无损压缩库和命令行工具,定位为 LZ4、Snappy、zstd 的替代品;它还能把日志和表转储变成带类型的列(
-r),以及针对文件的旧版本压缩新版本(--base)。
使用入口
仓库地址:https://github.com/surya-koritala/Glyd。项目说明文档入口见 README。
据项目自述,GPU 侧的快速上手方式为:
curl -LsSf https://getglyd.com/install.sh | sh glyd run Qwen/Qwen3-8B
与 vLLM 配合或在 Python 中使用:
pip install "glyd[vllm]" vllm serve Qwen/Qwen3-8B --quantization glyd
import glyd
model = glyd.from_pretrained("Qwen/Qwen3-8B")
压缩库与 CLI 的安装与用法(项目自述):
brew install surya-koritala/glyd/glyd glyd --max events.json -o events.glyd glyd -d events.glyd -o events.json
许可与限制
仓库整体许可证为 BSD-3-Clause。项目自述对许可做了分拆说明:编解码部分(glyd crate、CLI、C ABI 以及 Python 和 Go 绑定)采用 BSD 3-Clause,或由使用者选择 GPL 2.0,与 zstd 的许可相同;而 store(glyd-store)与 GPU 包(glyd-gpu)采用 Business Source License 1.1,个人、研究及其他非商业用途免费,商业生产使用需要获得许可,每个版本在发布四年后转为 Apache-2.0。上述分拆许可以仓库 LICENSE 为准。
硬件与系统限制(项目自述):需要 Linux(x86_64 或 aarch64)搭配 NVIDIA GPU,架构为 Ampere、Ada 或 Hopper,驱动版本 580 或更新。
项目自述还提到,并非所有场景都快于 bf16,完整结果以及 Glyd 目前仍慢于 bf16 的情况,需要查阅其基准测试页面。本站未对这些性能数据做独立验证。