Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER H 37 约 1 分钟

KV压缩策略也可以按上下文现学

KV-Kaizen让模型看过当前文本后,再逐层决定怎样压缩KV缓存。

模型读得越长,显存里的“草稿纸”就越厚。KV缓存——模型保存此前词语计算结果的地方——能避免反复重算,却也会拖慢逐词生成。常见办法按固定规则删内容,但今天删掉的信息,后面可能恰好有用。KV-Kaizen的不同之处,是先看当前上下文,再决定这次该怎样省空间。

它安排一个小型选择器,在模型正式处理提示词前运行一次,并为每一层挑选缓存方案:让多层共用缓存、降低存储精度,或缩短缓存的低维表示。三种温和调整可以组合使用,并共同服从总容量预算;选定后,整段生成过程不再改变。选择器还与模型一起微调,让模型提前适应自己将拿到的压缩缓存。

作者称,在指令跟随、推理和长上下文任务中,这种按内容、按层调度的方案,在相同缓存大小下优于无需学习、事后套用或人工设计的基线。它不主动删除词元,也能与缓存驱逐叠加。不过,现有材料未给出完整的具体压缩比例与设备收益数字,因此这里不作量化延伸。


供稿材料 SOURCES — 1
01
KV-Kaizen: Learning Context-Adaptive Cache Compression Choices arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-03 · 学术板块