让 AI 回答多个文档的问题,常像每次都要重新翻一遍资料。RAG(检索增强生成)会先找出相关文档,再交给模型阅读;不同提问可能反复用到同一文档。KV Cache(键值缓存)是模型阅读时留下的“索引卡”,能免去重复计算,但长文越多,卡片越占存储,搬运也越慢。
C²KV想同时解决两件事:把这些索引卡压小,并让不同文档的缓存可以换位置、重新拼装。难点在于,普通压缩缓存往往依赖原来的上下文和位置,直接拼接会明显损害准确率。作者为此给冻结的基础模型外挂一个轻量 Extractor,用可学习的压缩词元汇总文档信息;训练时又让它直接适应缓存片段的拼接与重排,产出“随时可拼”的表示,无须修改基础模型本身。
作者称,C²KV在多种长上下文基准和模型上保持生成质量,同时降低缓存存储与传输成本,长上下文推理最高加速 17 倍。这个方向值得注意,因为它不只省去重复阅读,还开始处理缓存本身太大、搬不动的问题。