Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 约 1 分钟

Transformers接入llama.cpp量化

Transformers可直接加载GGUF量化模型,本地运行少一步格式转换。

IMAGE — Hugging Face Blog

想在自己的电脑上运行 AI 模型,过去常要先转换文件格式,再换到另一套工具里启动。如今,Hugging Face Transformers——常用的模型开发库——开始直接支持 llama.cpp 生态的 GGUF 量化模型。GGUF 是把模型权重、词表和配置等装进一个文件的格式;量化则用较低精度保存参数,以少量精度损失换取更小体积。开发者可以继续使用熟悉的 from_pretrained 接口加载模型,省去一层手工转换。

以 Unsloth 发布的 Qwen3.5-4B 为例,材料中的 BF16 原始版本为 8.42 GB,Q4_K_M 量化版降至 2.74 GB,后者主要使用 4-bit 权重,并为敏感部分保留更高精度。Transformers还复用 llama.cpp 底层的 ggml 计算内核,并削减生成环节的额外开销。不过目前重点仍是 Apple Silicon 上的本地推理,首批从 Qwen3.5 架构开始;不同量化等级会损失多少质量,也要按具体模型和任务测试。


供稿材料 SOURCES — 1

← 返回 2026-09-23 · 科技板块