让小模型读很长的材料,常见做法是删掉一部分“旧笔记”来省显存;麻烦是,一旦删掉关键线索,后面就可能答错。这里的笔记叫 KV 缓存——模型读文本时保存的中间结果。TwinKV 想做的不是重新设计淘汰规则,而是在删除之后补一次漏。
它先找“成对的键”:键向量可理解为模型检索历史内容时使用的索引。若某条被删记录没有近似副本留下,它就是信息缺口;若某条保留记录已有近似副本,它又占了一个冗余名额。TwinKV 会交换两者,在不增加缓存预算、也不改原有评分规则的前提下,近似补回被误删信息的影响。
作者还用逐条移除再观察正确答案概率变化的办法发现,模型“看了多少”与信息是否真正影响答案只有很弱关系。实验中,TwinKV接在四种淘汰策略之后,在Qwen3-4B上对其中两种策略的多数测试配置有帮助,对另两种则接近持平或仅少数有效;效果也会随模型和任务变化。它更像一层可组合的补救,而不是稳定取胜的新淘汰法。