你让 AI 反复参考同一批长文档,只是换个问题或调整顺序,它往往还得从头再读一遍。原因是旧的 KV 缓存——模型读文档时留下的“索引卡”——会受文档位置和前文影响,搬到新上下文里容易失真。对频繁重排资料的 Agent 来说,这意味着昂贵的预填充,也就是回答前的整段阅读和缓存建立,反复发生。
SemPIC 的做法是把功夫放在离线制备缓存时:启用 LoRA——一种轻量训练模块——作为 Writer,学习为整篇文档生成更耐位置变化的原生 KV;真正回答问题的 Reader 仍是未经修改的预训练模型,也不需要新的缓存格式。关键不只在文档边界,而是让内部每个词的表示都能调整,因为作者发现,仅修补边界仍会留下明显的内部偏差。
据论文作者报告,SemPIC 在三个模型、四项任务上,将相较方案 KV Packet 的平均 micro-F1 从 0.53 提高到 0.60,接近每次完整重算的 0.62,并在 12 组设置中的 10 组胜出。它还没有完全追平重算,但证明了同一文档即使换指令、聊天历史或排列顺序,也可能继续复用缓存。