让本地 AI 读更长的对话,内存往往先吃紧。原因之一是 KV Cache——模型保存前文注意力计算结果的“草稿纸”——会随上下文增长。把它改用低精度数字存放能省内存,却也可能让回答偏离原模型。这次测试比较了 Gemma 4 31B 的普通 Q4_0 量化版与 QAT 版;QAT(量化感知训练)会在训练时预演低精度误差,让模型提前适应压缩。
最值得看的,是 q4_0 KV Cache 设置:作者报告,普通版的平均 KLD 为 0.880436,QAT 版降至 0.090504,相差 9.7 倍。KLD 衡量量化前后“下一个词”概率分布偏移多少,越低通常表示变化越小;两者首选词相同的比例也从 71.630% 升至 86.337%。这给长上下文本地部署一个直接信号:如果还要压缩不断增长的 KV Cache,QAT 版更可能保住原有输出。结果来自作者借助 BeeLlama.cpp 分支所做的测试,尚不能替代不同任务与硬件上的独立验证。