AI 解难题时,常会写出越来越长的“草稿”。问题是,它通常把每一步都留在显存里:哪怕前面的计算已经用完,也不肯丢。推理越长,这叠草稿就越厚,最终可能不是题太难,而是机器先装不下。Prefix Sliding 想解决的正是这个问题,让测试时扩展——回答时投入更多计算、允许模型想得更久——不再首先受内存限制。
它只保留两部分:固定前缀,也就是题目、规则和工具说明;以及最近几千个词的滑动窗口,也就是模型眼下正在处理的思路。更早的中间步骤会被清走。比如算完“42+84”后,后续通常只需要结果,不必继续保存加法过程。这样,KV 缓存——模型为避免重复计算而保存的中间结果——不会随推理链无限增长。论文举例称,100 个词的前缀配合 4096 词窗口,内存中最多保留 4196 个词。
作者报告称,这种方法无需重新训练即可在维持表现的同时提速 3 倍;配合强化学习训练,还能把推理轨迹扩展到 10 万词以上。结果仍来自论文作者的实验,但它给出了一条直接思路:长推理未必需要记住全部过程,守住任务说明和近期思路或许就够了。