Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
PAPER 约 1 分钟

KV缓存开始按思考内容压缩

TAM按推理片段的重要性分配缓存空间,让长思考少占显存,也尽量少丢准确率。

模型思考得越久,越像把每一步草稿都摊在桌上:内容不断增加,桌面很快不够用。这里的“桌面”是显存,草稿则是 KV 缓存——模型保存此前文字的中间计算结果,免得生成下一个词时从头重算。问题在于,长思维链里既有关键结论,也有后来已无用的岔路,全部等量保留并不划算。

作者提出 TAM:先按段落边界把推理过程切成多个思考片段,再观察模型近期生成时真正回看了哪些内容。这里的“注意力”就是模型给旧内容分配的参考权重。TAM据此自适应分配压缩空间:重要片段多留,次要片段少留,同时保护受到高度关注的关键 Token(文字单位)。

据论文作者在 Qwen3-4B 上的实验,定期压缩把峰值显存限制在 3.1—3.2 GB,较不压缩降低 65%;在 AIME 2024 和 MATH-500 上,准确率分别为 56.7% 和 65.4%,低于不压缩时的 63.3% 和 71.2%。它展示的不是“无损省显存”,而是一种更懂推理内容轻重的取舍。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 学术板块