Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.037 — 2026-08-10
PAPER 约 1 分钟

被逐出的KV还能救回来

QEvict给被淘汰的KV留一份低比特备份,注意力转移后还能重新启用。

你让 AI 读一篇长文,起初不起眼的一句话,可能到后面才成为答案线索。问题是,为节省显存,系统常按当下的“注意力”删掉旧内容;注意力就是模型生成新词时,对前文各处分配的关注权重。一旦关注方向变化,那些已经删除、后来又变重要的信息便找不回来了。

QEvict把这种“一删了之”改成三级管理。KV 缓存——模型为避免反复重算而保存的前文中间结果——被按连续片段分组:重要片段保留完整精度,中等片段量化成低比特备份,最不重要的才永久删除。低比特备份仍参与注意力计算;某个片段重新受到关注时,系统会将它解码并调回完整精度。更细的一点是,每个片段只在首次降级时量化,之后反复调入调出都复用同一份备份,避免多次近似转换不断积累误差。

作者在 LongBench、RULER 和 GSM8K、三类指令微调模型及多种显存预算下测试,并自述 QEvict 相比代表性的淘汰与量化方案,持续改善了效果与显存占用的取舍。它的价值不只是“压得更小”,而是承认模型的关注重点会漂移,给暂时失宠的信息留了一条回来的路。


供稿材料 SOURCES — 1

← 返回 2026-08-10 · 学术板块