Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER H 32 约 1 分钟

KV量化开始盯住查询目光

NOVA-KV按查询真正关注的方向压缩缓存,用2比特尽量守住注意力结果。

模型读得越长,KV 缓存——保存前文中间信息的“随身笔记”——就越大。生成每个新词时,它都要把这本笔记搬出来;搬运甚至比计算更费时。压缩能提速,但若一视同仁地删减精度,模型可能恰好看不清回答问题所需的内容。

NOVA-KV 的关键,是按查询的“目光”设计压缩:注意力会衡量新词该看向前文哪里,作者因此不只追求还原缓存本身,而是优先减小查询与键相乘后的误差。他们为键推导出一种非正交变换——把数据转到更适合压缩的坐标系,且不像以往方法那样局限于保持原有几何关系;随后用向量量化,把一组数字整体匹配到码本中的代表值,并通过分组维持每个词固定的比特数。

作者报告,在每个元素仅用 2 比特时,该方法挽回了标量量化在长文本检索中损失的大部分准确率,长上下文下速度与标量基线相当;在 GPT-OSS-20B 上,既有两比特变换在各个测试长度均失效,而 NOVA-KV 仍然有效。这些效果目前来自论文自身实验。


供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块