给大模型“瘦身”有点像压缩照片:文件更小、运行更省资源,但细节可能丢失。量化就是用更低精度保存模型权重。这次,作者把 Qwen3.6 27B 的 16 种量化版本放到同一张表里,涵盖 GGUF(llama.cpp 常用的模型格式)、AWQ、AutoRound,以及 FP8 和面向 NVIDIA 硬件的 NVFP4。
作者逐个 token 比较量化模型与未量化原版对下一个词的预测分布,并用 KL 散度衡量偏离程度,数值越低通常越接近原模型。按其测试,在相近权重体积下,GGUF 结果大多处于质量—体积曲线的较优位置。两个常规 Q4 GGUF 的 KL 散度分别为 0.2218 和 0.2273;AWQ 与 NVIDIA mixed NVFP4 则分别为 0.2776 和 0.2807,几乎持平。作者推测,GGUF 不量化激活值可能是优势来源之一;部分 vLLM 方案还会压缩激活值,甚至 KV cache——模型生成时暂存中间结果的“草稿纸”。这是一位作者基于特定模型、测试集和推理框架所做的横评,不能直接等同于所有硬件上的速度或实际体验。