你请 AI 反复参考同一本厚手册,它通常每次都要重新找资料、重新阅读。Sietse Schelpe 提交于 arXiv 的这篇预印本换了一个思路:模型第一次读完后,直接保存它当时形成的内部计算状态。以后再遇到相关问题,就把这份状态接回去,不必从头读一遍。
这项工作针对的是知识复用的成本。它没有重新训练模型,而是在冻结的 Gemma 4——即权重不再修改的模型——上移植 KV cache。需要先说明:目前的效果数字主要来自论文作者,实际引擎也未公开,尚不能视作独立复现。
不存原文,存下“读过之后的状态”
KV cache 是模型生成文字时留下的中间结果:此前每个 Token(模型处理文字的基本单位)在注意力层中对应的 Key 和 Value 会被保存,避免下一步重复计算。可以把它理解成模型阅读时写下的草稿。
常见的 RAG(检索增强生成)会先从资料库找出相关文本,再让模型现场阅读。论文的方法则把已经验证过的知识保存为 KV 状态,需要时“嫁接”进新的推理上下文。它保存的不是一段供模型重读的资料,而是模型读完资料后形成的内部状态。
关键要求是嫁接不能悄悄改变计算。论文所说的“字节精确”,指恢复状态后的结果与重新计算所得结果逐字节一致,而不只是最后答案碰巧相同。据 arXiv 摘要,作者在固定、确定性的配置下,用 SHA-256 校验恢复后的 logits——模型为下一个 Token 给出的原始分数——与重新计算结果;50 个样本的 KL 散度为零,argmax 一致率为 100%。摘要还称,这项验证覆盖 12B 和 31B 两种模型规模及两种 GPU 目标,其中一项采用预注册回放。
90% 到底指什么?
标题容易造成误会:90% 不是缓存命中率。Reddit 发布帖称,在 Gemma 4 12B 上,缓存知识把同一路由系统的 AIME 2025 成绩从 76.7% 提高到 90.0%。AIME 2025 是这里用于衡量数学解题表现的测试。
但 arXiv 摘要给出的口径不同:嫁接已验证解题库后,冻结的 Gemma-4-12B 成绩从 80.0% 升至 93.3%。摘要还把留出迁移能力建立在 31B 模型“7 题全中”的结果上。两组数字存在差异,现有材料没有解释它们是否来自不同设置,因此不能混写成同一项结果。
论文还报告了更直接的成本案例:八道基础模型在 401,026 Token 预算内始终没有解出的重复问题,接入缓存解后只使用 61 个解码 Token。作者据此计算 Token 用量减少 6,574 倍,估算能耗降低约 8,700 倍。这个结果展示的不是模型突然学会了新知识,而是已完成的推理可以被低成本调用。
为什么值得关注
这条路线把“给模型知识”的问题,从修改权重或反复提供文档,改写成管理可恢复的运行状态。如果它能在更多任务和开放系统中复现,知识就可能像经过验证的计算组件一样被保存、搬运和复用。
论文还称,同一种状态存储把可用上下文从 32,768 Token 扩到 2,854,766 Token,且不增加加速器内存。这表明 KV 状态不仅可能减少重复阅读,也可能成为承载超长知识的一种方式。
局限与未知
- 论文只公开了系统行为层面的描述,实际引擎仍是专有实现,外界目前无法完整检查或复现。
- 摘要没有充分交代缓存构建成本、评分细节与更多重复实验;极大的 Token 和能耗降幅也仍是作者口径。
- Reddit 帖称作者计划于 7 月 19 日在 AGI Summit 推介该方法。这只是作者计划,不等于会议议程已经确认。