Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
PAPER H 2 · HF 64 约 1 分钟

KV缓存只存Value,Key随用随算

只缓存“内容”,索引随用随算:GVA以计算换内存,缓存缩小约一半。

把大模型生成长文想成查资料:Key 是目录索引,Value 是索引指向的内容。模型通常把两者都留在显存里,文本越长,这本“随身资料册”就越占空间、越费读取带宽。Grouped Value Attention(GVA)的思路很直接:只长期保存分组后的 Value,需要 Key 时,再通过学到的线性变换重建。

更巧的一步是,推理时这项变换可以提前并入 Query——模型当前用来检索资料的“问题”。因此,预期的逐词生成路径甚至不必真的生成内容 Key。位置信息则由一条很小、各注意力头共享的 RoPE 通道单独保存;RoPE 是让模型知道词语先后关系的位置编码。论文报告,在所测配置中,GVA 比对应的 GQA 缓存标量减少约 45%–47%。

在 3.5 亿参数、300 亿个 FineWeb-Edu token 的实验中,16 维位置版本在五项任务上的平均准确率为 44.35,几乎追平 GQA 的 44.36,并高于 MLA 的 43.88。作者明确表示,延迟和生成吞吐量是否真的改善尚未得到实验确认,定制解码内核仍在评估中。


供稿材料 SOURCES — 1

← 返回 2026-09-18 · 学术板块