Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.043 — 2026-08-16
PAPER 约 1 分钟

混合LLM缓存,一个状态就够

LinearKV让混合LLM复用旧提示时,每层递归缓存只留一个状态,直接降低首字等待成本。

同一份长文只是在提示里换了位置,AI 服务往往就得重新读一遍。位置无关缓存(PIC)想把旧计算直接搬过来,但混合 LLM 卡在了这里:它的大量递归层会把前文压成一个固定大小的状态,像只保留一页滚动摘要,无法像传统注意力层的 KV Cache(模型保存的中间结果)那样按词拼接和局部修补。

LinearKV 的做法是把两类层分开处理:传统注意力层照旧拼接缓存,递归层则用一个已匹配文本块的缓存状态作为起点,再沿用现有 PIC 方法挑选少量位置重算。最反直觉的一点是,把所有文本块精确合成为完整状态并不更稳;作者称,单个状态在两种 GDN 模型上与精确合成相当,而在 Mamba-2 模型上,精确合成反而在三种选择器下都失效。随机选一个文本块也能得到相近结果,说明关键在“单一来源”,而非选中了哪一块。论文在三种混合模型、三种 PIC 选择器及 8K–32K 长度的 LongBench QA 和 RULER 上验证,并报告首个 Token 等待时间低于完整预填充;材料中的部分质量数字缺失,因此不作具体引用。


供稿材料 SOURCES — 1

← 返回 2026-08-16 · 学术板块