像整理会议记录:正文可以压成摘要,但发言顺序最好另存。MLA(Multi-head Latent Attention,多头潜在注意力)也是如此。它把多个注意力头所需的内容压进共享的内部摘要,只缓存这份摘要;位置信息则经由独立的 RoPE 通道绕过压缩瓶颈。论文研究的重点不是再报一次省了多少显存,而是检查模型是否真的学会了这种分工。
作者训练了一个 1.14 亿参数、24 层的 MLA 模型,并用线性探针——从内部表示中读取特定信息的小型分类器——检查压缩前后留下了什么。作者报告,实体身份信息保留率为 98%,位置信息的识别准确率却接近随机猜测。这说明瓶颈主要保存“前文写了什么”,把“它出现在哪里”交给独立位置通道;也解释了该架构为何能把生成时的 KV Cache——避免反复重算前文的中间结果——缩减 81%。不过,这些结果只来自一个在 TinyStories 上微调的小模型,尚不能直接代表数千亿参数的生产模型。