Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.023 — 2026-07-27
PAPER H 1 约 1 分钟

百万词元投机解码甩掉草稿税

只让草稿器看局部上下文,百万词元投机解码不再被缓存读取拖慢

像请助手先拟几句,再由主编统一核稿:助手若每写一句都要翻完百万词元的档案,草稿反而成了负担。投机解码正有这个问题——较便宜的草稿模块先猜一串词元,主模型再并行核验;但长上下文下,草稿端读取 KV 缓存(保存前文计算结果的“速查表”)也会很慢。

Alagappan Valliappan 提出的 Windowed-MTP,只让内置 MTP 草稿器查看开头少量“注意力锚点”和最近的滑动窗口,主模型仍读取完整上下文并决定哪些词元可以采用。这样改动的只是猜法,不是最终裁决;方法无需训练,也不增加参数。论文在三类模型、单张 GPU 和 100 万词元上下文中测试,作者报告:相较原生 MTP 草稿器,每轮“起草加核验”的成本降低 28%—44%。

更实际的一点是,窗口外的草稿 KV 缓存不再需要读取,可改成紧凑的环形缓冲区;论文测得,草稿缓存原本占总 KV 的 7.7%—11%。换句话说,这项工作没有让草稿器猜得更复杂,而是让它少翻旧账,使百万词元场景下的投机解码更可能真正省时。


供稿材料 SOURCES — 1

← 返回 2026-07-27 · 学术板块