给模型“瘦身”有点像压缩照片:省空间不难,难的是别把人脸细节也一起抹掉。权重量化——用更少位数保存模型参数——通常统一降低精度,但不同权重组未必同样耐压。开发者 enginetown 因此做了一套测试工具:每次只量化一组权重,再用 KL 散度(衡量两组概率分布差异的指标)比较它与全精度模型的输出,并覆盖通用对话、代码、数学和工具调用提示。
作者自述,权重组的大小和职责相近,并不代表抗压能力相近;有的在激进压缩下仍稳定,结构上的“孪生组”却会提前两个等级出问题。测试中,明显偏差集中出现在每个权重约 3.5 至 3.9 bit 的窄区间,工具调用又往往最先受损。它的价值不在于发明新技巧——作者也承认资深量化者早会凭经验逐组判断——而在于把经验变成可重复的数字,为混合精度量化提供依据:能压的多压,敏感的部分保留更高精度。以上结果来自作者在 Reddit 的自述,尚非独立评测。