让 AI 读一部长篇再逐字回答时,慢的不只是在“想”,还在反复翻资料。解码——模型一个 token 接一个 token 地生成内容——每一步都要读取 KV 缓存,也就是为查阅前文保存的中间记录。上下文越长,这次读取越可能成为瓶颈。LOCKS 的思路是:别每次把整本资料都翻一遍,先看各页的索引。
它利用注意力键“页内可由少数模式概括、跨页却差异很大”的特点,为每页单独制作谱摘要,大小约为原缓存的十分之一。模型先用摘要估算各页获得的注意力总量,只完整读取排名靠前的页面;筛选阶段不读取候选页的原始键和值。关键不只是压缩,而是避免用一套全局摘要抹掉各页独有的信息。作者称,该方法在 LongBench-v1 等任务上接近读取完整缓存的质量,并可降低逐 token 延迟。不过 LOCKS 仍让完整 KV 缓存常驻显存,解决的是读取带宽,而非缓存容量。