模型读得越长,随身携带的“笔记”就越厚。KV 缓存——模型保存旧 Token(文本中的基本单位)中间数据的地方——能避免每生成一个新词都从头计算,却也会迅速占满显存。现有量化通常把整份笔记统一换成低精度格式,重点是让压缩前后看起来尽量相似;这篇论文则追问:哪些误差真的会让模型读错重点?
作者把问题改写成变换编码——先将数据换到更容易压缩的表示,再把有限精度留给重要成分,思路类似 JPEG。论文证明,在其白噪声量化模型下,误差对注意力机制(模型从上下文中挑选相关信息的过程)的影响,可以拆成 Key 与 Value 两部分,并进一步按 Token 和数据通道分解。基于这一结构,AATC 会用校准数据估计各部分的重要性,再有区别地分配比特,而不是平均压缩。
作者报告,在 Llama-3.1-8B-Instruct 与 Qwen-2.5-7B-Instruct、五组评测上,AATC 约压缩 5.8 倍时仍接近无损准确率,而各基线至少在部分设置中退化。更值得留意的是,它提供了一套统一尺度:压缩算法不只应比较缓存还原得像不像,还应衡量误差最终怎样改变注意力。