AB
AiBoss站
快讯

Transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

Hugging Face 宣布在 transformers 中加入对 GGUF 模型的支持,用户可通过 from_pretrained 直接加载 Hub 上的量化检查点,在本地进行推理。官方称初期聚焦 Apple Silicon 本地推理,并复用 llama.cpp 的 ggml 内核以贴近其性能表现。

核心事实

据 Hugging Face 博客文章,transformers 现已支持运行 GGUF 格式模型。用户可以从 Hub 上选取 GGUF 检查点,通过 from_pretrained 加载并在本地生成内容。文章称,为让性能接近 llama.cpp,团队通过 kernels 库复用其底层 ggml 内核,并减少了 generate 中的开销。初期重点据报为 Apple Silicon 上的本地推理,从 Qwen3.5 架构开始。

背景与影响

GGUF 由 llama.cpp 团队开发,把模型权重与元数据(含分词器信息和可选聊天模板)打包在单个文件中,并支持不同量化级别,以精度换取更小的内存占用。文章提到,Unsloth、LM Studio Community、bartowski 等发布方在 Hub 上提供多种量化版本,GGUF 模型下载量已达数百万次。此次集成意味着开发者可在熟悉的 transformers API 中试验 GGUF、评估量化检查点、校验 GGUF 转换,或反量化后继续训练。文章同时强调,若优先考虑高效本地推理,llama.cpp 仍是其推荐的引擎。

限制与来源

文章列出的前提条件包括:一台 Apple Silicon Mac、受已发布 ggml 量化内核构建支持的 PyTorch 版本(通常为最近两个版本),以及最新版 transformers(目前为 main 分支,直到下个版本发布)和兼容版本的 kernels。若无法获取相应内核,加载器会回退到反量化,占用更多内存;也可显式传入 attn_implementation="sdpa"。文章称初始 GGUF 示例覆盖文本生成,其他架构仍需逐一集成与验证。上述功能、支持范围与安装方式均可能变化,请以官网当前信息为准。本文内容来自 Hugging Face 博客,尚未获独立确认。