Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
PAPER HF 10 约 1 分钟

旧KV缓存能给小模型移植知识

把验证过的知识存成KV缓存,小模型不用改权重,也能直接复用。

像把一页已经核对过的答案夹进书里:下次遇到同一道题,小模型不用重新推导,直接翻到那一页。Sietse Schelpe 提出的 Taliesin,把验证过的知识保存为 KV Cache——模型阅读文字时留下、供注意力机制回看的中间笔记,再按需植入冻结模型,也就是完全不改模型参数。

关键不只是省计算,而是“字节精确”。作者在固定的确定性环境下,将缓存植回原来的绝对位置;所得输出分数逐字节一致,50次测试的概率分布 KL divergence 为零,最高概率答案也全部相同。换句话说,这不是一份近似笔记,而是在数值上复现模型重新读过原文的状态。位置一旦移动,精确性就不再成立。

作者称,在 AIME 2025 上,冻结的 Gemma-4-12B 借助已验证解答库,成绩从其自身最佳设置的80.0%升至93.3%。这让知识可单独保存、复制和核验。不过,植入引擎并未开源,内部机制属专有技术;目前公开材料能核对输出哈希与评分,不能独立复现整套生成过程。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 学术板块