Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.020 — 2026-07-24
PAPER 约 1 分钟

无损加速也有硬件账单

实测显示:投机解码保持输出不变,却未必能在消费级硬件上提速。

让一个小模型先替大模型猜几步,再请大模型一次检查,听起来像是把逐题批改变成整页批改。这就是投机解码:草稿模型便宜地提出候选词,目标模型批量核验;严格的接受与拒绝规则保证最终文字的概率分布不变。它值得关注,因为生成文字常卡在搬运模型权重,而不是计算本身,批量核验理论上能少搬几趟。

这项研究把理论放到一台配备 18 GB 统一内存的 Apple 芯片笔记本上检验,并比较五种草稿模型、目标模型与运行后端的组合。作者报告,其中三种组合反而减速。一个原因是草稿模型每走一步,竟比小型量化目标模型更慢;另一个更反直觉:量化 Metal 后端对多个候选词的“并行”核验,耗时会随候选数量近似线性增长,等于仍在逐个处理。再加上双模型调度、设备同步和内存占用,理论收益很容易被吃掉。

结论很朴素:无损只代表不改变输出分布,不代表没有硬件账单。投机解码要真正提速,既要草稿明显更快,也要目标模型的批量核验确实并行;论文摘要中的部分具体速度数字未能完整呈现,因此这里不作延伸。


供稿材料 SOURCES — 1

← 返回 2026-07-24 · 学术板块