你在笔记本上下载了一个压缩过的大模型,运行很顺;想进一步检查输出、做评测或接入开发工具时,却发现它和常用工具不在同一套体系里。过去,这类割裂很常见:本地推理常用 llama.cpp,研究、调试和微调工具则多围绕 Hugging Face Transformers 构建。现在,Transformers 开始原生读取 llama.cpp 生态的 GGUF 文件,试图把两段工作流直接接起来。
这项功能目前只有 Hugging Face 一方披露,功能范围和性能数字均缺少第三方复测。它更像一道刚搭好的桥,还不能视为所有平台、模型和量化方案已经无缝互通。
一个文件,进入两套世界
先解释几个名字。Transformers 是 Hugging Face 维护的模型开发库,为模型加载、训练和推理提供统一接口。llama.cpp 则是一个用 C/C++ 实现的本地推理项目,重点是在 CPU 和消费级硬件上运行大模型。
GGUF 是 llama.cpp 长期使用的模型文件格式。它能把模型权重、量化信息和元数据装进一个文件,方便下载和运行。这里的“量化”,是用更少的位数保存模型权重,以降低文件大小和内存占用;代价通常是损失一些精度,而且运行时可能需要专门的计算内核。
按照 Hugging Face 发帖者给出的示例,用户现在可以在 AutoModelForCausalLM.from_pretrained(...) 中通过 gguf_file=filename 指定 GGUF 文件。加载完成后,模型继续使用常规的 Transformers API。换句话说,同一份原本面向 llama.cpp 的压缩模型,如今也能进入 PyTorch 工具所在的环境,用来调试、评测或编写自定义生成流程。
变化看似只是“多支持一种文件”,实际价值在于少做一次搬运。以前,开发者可能要在适合研究和修改的模型格式、适合本地运行的 GGUF 之间来回转换。每多一次转换,就多一层等待、兼容检查和出错机会。原生加载把格式转换从工作流中拿掉了一段,也让模型加载、开发工具与本地部署有机会围绕同一文件衔接起来。至于它能否直接覆盖各种微调方式,现有材料没有说明。
原生读取,不等于先解压再跑
在受支持的 Apple Silicon——苹果自研芯片平台——配置上,Transformers 还能复用 ggml kernels。kernel 可以理解为针对具体硬件和计算任务写好的底层运算程序。这样,模型可直接从压缩后的量化权重运行,不必先恢复成更占内存的普通权重。
Hugging Face 在 M2 Max 上做了三组自测。Qwen3.5-4B 的 Q4_K_M 版本达到每秒 70.4 个 token,llama.cpp 为 71.8;token 是模型处理和生成文本时使用的基本片段。Qwen3.5-35B-A3B 的 UD-IQ4_XS 版本分别为每秒 60.2 和 61.3 个 token。至少在这两组特定配置里,Transformers 与 llama.cpp 的速度相近。
第三组数据写作“Qwen3.8-27B” UD-Q4_K_M:Transformers 为每秒 15.9 个 token,llama.cpp 为 13.4。不过这个模型名称疑似笔误或异常命名,因此不能据此下结论。
性能优化也没有停留在接口层。据 Hugging Face 介绍,团队连续测试时发现,M2 Max 发热会让速度下降至少一成,因此每轮基准测试之间强制冷却 90 秒。他们还发现,每生成一个词都让 CPU 等待 GPU,会积累大量短暂停顿;把停止判断延后一步、减少两者同步的次数,才降低了这部分损耗。所谓“原生支持”背后,仍是这些细小而具体的工程调整。
为什么值得现在看
这次整合还有一层组织背景。据 Hugging Face 介绍,GGML 与 llama.cpp 团队已于 2026 年 2 月加入 Hugging Face,但 llama.cpp 仍由原团队自主决定技术方向,并保持完全开源。约七个月后,原本分别偏向“本地推理”和“模型定义与开发”的工具,在 Transformers 内直接会合。
这并不意味着 Transformers 要取代 llama.cpp。发帖者明确表示,如果唯一目标是获得最高的本地推理性能,llama.cpp 可能仍是更好的选择。新功能真正有意思的地方,是让 GGUF 不再只停留在运行终点:开发者可以在熟悉的 Transformers 环境里加载它,再调用既有工具。对整个生态而言,少一道格式边界,往往比多一个孤立功能更重要。
局限与未知
- 所有功能说明和跑分都来自 Hugging Face 单一信源,尚无第三方复测;测试也未披露软件版本、提示长度、生成长度、线程、批量与采样配置。
- 材料只明确提到受支持的 Apple Silicon 配置,没有给出完整的平台、模型架构、量化类型和版本兼容范围,不能理解成任意 GGUF 都能直接高性能运行。
- “Qwen3.8-27B”的名称需要进一步核对;现有材料也未说明直接微调量化权重的具体支持范围。