Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER 约 6 分钟

推理模型给自己打草稿

SSR 让推理模型边思考边替自己起草答案,省去额外草稿模型,长代码生成延迟最高降 24.1%。

你让 AI 写一段较长的程序,它可能很早就想好了大致结构,却仍要一个词片段接一个词片段地输出。多数语言模型采用“自回归生成”:每次只生成一个 Token——一个字、词片段或符号——下一步必须等上一步完成。答案越长,等待越明显。

一篇新论文提出 SSR(Self-Speculation for Reasoning Models),让推理模型在思考途中先替自己打草稿,等完整思考结束后再集中核验。它不需要另训一个小模型,也不修改模型权重。论文报告,在部分结构化及长文本任务上,总生成延迟最多降低 24.1%。不过,全部证据都来自作者自己的论文与初步实验,尚无第三方复现。

同一个模型,先交草稿再交定稿

推理模型通常先生成一段推理轨迹,也就是解决多步问题时的中间分析,再给出最终答案。推理轨迹可能长达数千个 Token。传统做法要等它全部想完,才开始逐 Token 写答案。

SSR 换了一个角度:模型想到一半时,先让它基于当前的部分推理轨迹起草答案;与此同时,原来的请求继续完成更长的推理。等完整推理结束,系统再用同一模型的“完整思考版”分布核验这份草稿。

可以把它理解为作者边整理材料,边让自己的早期版本先写初稿。终稿依据仍是完整材料,但初稿中已经写对的段落不必重写。

这属于“投机解码”:先提出一串候选 Token,再让目标模型批量检查。连续通过检查的前缀可以一次接纳,遇到第一个不合格的位置再修正。传统方案常配一个更小、更快的草稿模型,但这意味着额外训练、显存占用和部署维护。SSR 属于“自投机”,草稿人和审稿人是同一个模型,只是推理预算不同。

论文把基于部分思维链得到的答案分布称为 drafter,把基于完整思维链得到的答案分布称为 verifier。作者观察到,推理越接近尾声,提前生成的答案往往越接近最终答案,不只意思相似,用词也更容易重合。于是,一份较晚生成的草稿可能整段通过,而不只是猜中下一个 Token。

第一句不同,不等于后面全都作废

普通投机解码主要接纳从开头连续匹配的部分。问题是,两版代码可能只在早期用了不同的变量名,后面却有大段相同逻辑。如果在第一个差异处丢掉整份草稿,就浪费了这些重合文本。

SSR 因而加入 suffix decoding,即“后缀解码”。系统把草稿建立成 suffix cache——一份可检索的文本片段索引。前缀核验中断后,模型继续生成时仍可从草稿里寻找与当前上下文衔接的后续片段,再逐段检查。它尤其适合代码、规划和其他结构固定、局部措辞容易变化的输出。

论文还提出迭代版本。由于系统事先不知道完整推理会有多长,也就很难挑中最佳起草时点。迭代 SSR 会在推理途中多次起草,并用较早草稿帮助生成较晚草稿。这样不必把成败押在一个时间点上。

提速来自“重叠工作”,不是少算

作者在 vLLM 推理服务框架中实现了 SSR。达到预设推理预算后,调度器复制请求:父请求继续思考,子请求开始写答案草稿。两者共享此前的输入和部分推理结果,避免把共同前缀重新计算。

这里有个容易误解的地方:SSR 所谓“无需训练”,不等于不花额外算力。草稿和完整推理会并行运行,短时间内反而增加计算负载。它压缩的是墙上时钟显示的等待时间,而不是总计算量。说白了,是把原本前后排队的工作叠在一起做。

实验采用 Qwen3.5-4B 与 Gemma-4-E4B-IT 两个约 4B 参数的开放模型,任务包括较长的类级代码生成 ClassEval、较短的函数补全 HumanEval,以及目标输出约 2,000 Token 的结构化任务 LongProc 2K。所有延迟实验使用 10 张 NVIDIA RTX A6000,每张卡运行一个 vLLM worker;单个请求的 batch size 为 1,模型不跨卡并行。

最清楚的结果来自 ClassEval。Gemma-4-E4B-IT 的基线总耗时为 79.2 秒,SSR 为 59.9 秒,按表中数据计算约减少 24.4%,与摘要所称“最高 24.1%”大体对应。Qwen3.5-4B 则从 85.3 秒降至 72.8 秒,约减少 14.7%。

HumanEval 的收益更小:Qwen3.5-4B 从 26.4 秒降至 25.2 秒,约减少 4.5%;Gemma 从 41.8 秒降至 35.5 秒,约减少 15.1%。作者的解释是,这类答案较短,时间更多花在推理轨迹上,而 SSR 目前只加速最终答案生成。草稿再准,也压不缩前面的思考时间。

为什么值得关注

SSR 的价值不只是又一种 Token 级加速技巧。它把推理过程中的阶段性答案当成可复用资产:模型早先花掉的计算,不必只作为通往终点的一次性过程,还能提前生产最终输出的候选文本。

这也让部署路径相对直接。论文实现不要求辅助参数、专用草稿模型或模型权重改造,可以作为现有推理服务的附加流程。对于代码代理、语音助手等既需要长推理、又在意响应时间的应用,这种“用更多并行计算换更短等待”的取舍有现实吸引力。

但它不是通用加速按钮。论文自己也指出,最终答案越长、结构越稳定,草稿越有机会抵消额外开销;如果答案短,或两次回答意思相近却用词不同,可复用的 Token 就会减少。

局限与未知

  • 结果仍属初步证据。附录写明探索性实验没有预热,每个设置只测量一次;全部数据来自作者,尚无第三方复现。
  • 最高约 24.1% 是特定模型、任务与硬件设置下的最佳结果,不能外推成普遍提速。SSR 也不减少总 FLOPs,并行起草会增加瞬时计算和缓存负担。
  • 标准拒绝采样核验可保持目标模型的采样分布,但论文所用后缀解码采用贪心匹配,属于近似加速。作者称实验保持输出质量,不过材料没有给出完整质量指标,尚不足以判断不同任务上的影响。

供稿材料 SOURCES — 1
01
Self-Speculation for Faster Reasoning Models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-27 · 学术板块