Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
NEWS 约 1 分钟

Gemma 4为KV缓存量化补课

KLD 实测显示,Gemma 4 31B 的 QAT 版更扛 KV Cache 压缩。

IMAGE — r/LocalLLaMA 日榜

让本地 AI 读更长的对话,内存往往先吃紧。原因之一是 KV Cache——模型保存前文注意力计算结果的“草稿纸”——会随上下文增长。把它改用低精度数字存放能省内存,却也可能让回答偏离原模型。这次测试比较了 Gemma 4 31B 的普通 Q4_0 量化版与 QAT 版;QAT(量化感知训练)会在训练时预演低精度误差,让模型提前适应压缩。

最值得看的,是 q4_0 KV Cache 设置:作者报告,普通版的平均 KLD 为 0.880436,QAT 版降至 0.090504,相差 9.7 倍。KLD 衡量量化前后“下一个词”概率分布偏移多少,越低通常表示变化越小;两者首选词相同的比例也从 71.630% 升至 86.337%。这给长上下文本地部署一个直接信号:如果还要压缩不断增长的 KV Cache,QAT 版更可能保住原有输出。结果来自作者借助 BeeLlama.cpp 分支所做的测试,尚不能替代不同任务与硬件上的独立验证。


供稿材料 SOURCES — 1

← 返回 2026-08-14 · 开源板块