AB
AiBoss
News

笔记本无GPU跑744B GLM:Colibrì把SSD当显存用

开源项目Colibrì以纯C实现分层推理,把MoE模型的冷门专家权重放在NVMe SSD上,按需读取,使744B参数的GLM-5.2可在无GPU的笔记本上运行。据报该项目在GitHub上已获约32k Star,支持多个模型家族。

核心事实

据量子位报道,GitHub上一个名为Colibrì的开源项目引发关注。该项目是一个纯C实现、零引擎依赖的分层推理框架,思路是把MoE模型中暂时用不到的专家权重放在NVMe SSD上,推理时按Router结果按需读取,从而让远超内存容量的模型在普通电脑上运行。报道称,744B参数的GLM-5.2经int4处理后权重约372GB,可在最低16GB、推荐约24GB RAM的机器上运行,GPU并非必需;作者最初的开发机为12核CPU加25GB RAM。报道还称该项目已覆盖9个模型家族,包括975B的Inkling与2.8T参数的Kimi K3,后者据称需要约1.6TB硬盘空间、RAM从32GB起步。

背景与影响

这一思路建立在MoE架构之上:模型总参数虽大,但每个token只激活其中一小部分专家,因此大量权重可以长期留在慢速存储中。Colibrì把Attention、Embedding、共享专家等常驻部分留在RAM,把路由专家放在SSD,并引入LRU缓存、专家使用频次统计与跨层预取来减少读盘。报道提到,相邻层专家路由存在相关性,提前一层预测的可预测性据称为71.6%。速度方面,报道给出的数字包括:冷缓存时约0.05~0.1 token/s,128GB RAM纯CPU桌面机约1.8 token/s,6张RTX 5090时约5.8~6.8 token/s。项目还提供Linux、macOS、Windows预编译版本与Web Dashboard,可查看专家分布与调用热度。

限制与来源

上述参数规模、内存与硬盘需求、速度数据均来自量子位报道及项目方说法,尚未获独立验证,实际表现会随硬件配置、模型版本与缓存状态变化。项目对具体模型的支持范围、预编译版本可用性与转换流程,请以项目仓库和官方文档的当前信息为准。本文不构成任何采购或投资建议。