Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
PAPER H 16 约 1 分钟

不同尺寸模型也能交接KV缓存

用闭式线性映射搬运KV缓存,让同家族大小模型切换时不必重读上下文。

想象你先让便宜的小模型读完一段长对话,发现问题太难,再换大模型接手。如今大模型通常得从头再读一遍。论文提出跨模型搬运KV缓存——模型读过文本后留下的“索引卡”——从而复用预填充,也就是回答前处理上下文的计算结果。

作者发现,同一家族、KV头数量和每头维度相同的模型之间,这些缓存存在明显的线性对应关系。他们为每个目标层挑选最有预测力的若干源层,先去掉键中的位置旋转,再用500段、每段1024个词元的FineWeb-Edu文本直接算出岭回归映射;“闭式”意味着参数可直接求解,不必训练复杂转换器。在Qwen3 14B到32B上,多层信息可解释目标键79%、值65%的变化。

据作者实验,六组模型中有四组保留了目标模型独立预填充时73%至98%的准确率,转换速度是重新预填充的2.7至25倍;另两组则明显退化。它因此很适合成本路由和对话中途升降档,但目前结论只覆盖KV结构匹配的同家族模型,也并非所有组合都能可靠交接。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 学术板块