Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER HF 25 约 7 分钟

推测解码闯进RL训练环

让草稿模型跟着策略一起学,NVIDIA 把推测解码推进了长上下文 RL 最昂贵的 rollout 环节。

你让 AI 反复练习解题。它每答完一次,系统打分,再据此调整模型。真正拖时间的,往往不是“改模型”,而是一次次把完整答案写出来。现在,NVIDIA 的一项工作试着给这个过程配上一名会同步进步的“速记员”:先由较便宜的草稿模型猜出后文,再让主模型批量验收,从而缩短生成时间。

这份 2026 年 9 月 7 日发布的技术报告,把这种办法带进了大规模、长上下文的强化学习后训练。强化学习后训练(RL post-training)是模型完成常规训练后,再通过“生成回答—获得奖励—调整行为”的循环继续学习。每次从题目走出一条完整答案或行动轨迹,叫作 rollout。论文瞄准的正是这个通常很昂贵的环节。

需要先说明:下文性能数字都来自 NVIDIA 作者自己的实验,目前只有单一实质性信源,尚无第三方复现。

草稿不能一直拿着旧剧本

推测解码(speculative decoding)的基本思路并不复杂。小型草稿模型一次猜出一串后续 token——token 是模型处理文字时使用的基本单位——大型主模型再并行检查。猜对的内容直接接纳,猜错处由主模型纠正。这样仍由主模型决定最终输出,却可能少走许多逐字生成的步骤。

但 RL 训练有一个麻烦:主模型一直在变。预先训练好、此后固定不动的草稿模型,会逐渐猜不准新策略想说什么。论文采用“在线共训”:草稿模型使用同一批 rollout token,并读取主模型中间层产生的特征,在主模型更新时同步学习。可以把它理解成会议中的速记员不仅记录发言,还持续适应一位不断改变表达习惯的发言人。

作者在 NeMo-RL 中实现了这套系统,并覆盖 EAGLE-3、DFlash 和 DSpark 三类草稿模型。它们提出候选内容的方式不同,但都需要处理带分支的注意力,并取得分散在主模型不同计算阶段里的中间特征。这正是工程难点。

两条路,绕开并行训练的堵点

大模型训练会把工作分给多块 GPU。上下文并行(context parallelism,CP)把一段很长的文本拆到不同设备;流水线并行(pipeline parallelism,PP)则把模型的不同层分段执行,像生产线一样传递结果。

标准 CP 擅长处理一条按先后顺序展开的主文本,却不直接支持草稿训练产生的分支。论文的做法是拆开计算:一部分处理分支对主序列历史内容的关注,另一部分只处理当前 GPU 持有的局部分支,最后合并两边结果。主序列采用 packed zigzag-ring attention:数据沿设备组成的环流动,同时通过打包和交错分配减少补齐与负载不均。这个统一方案可服务三类草稿。

另一个问题发生在流水线上。草稿模型位于最后一个阶段,它需要的主模型特征却可能来自前面的多个阶段。作者设计了 TapChannel:在原有流水线之外另开一条侧路,把中间特征直接送到草稿所在阶段。每个来源都有预分配的“邮箱”和顺序标记,生产者写入,草稿在相应计算前读取。它不要求修改原有流水线调度;如果传输能藏进两个阶段之间原本就有的空档,额外等待就很小。

加速有多大,要看账怎么算

作者测试了从 8B 到 122B 参数规模的五种主模型。跨模型与草稿组合,主模型每次验证平均接纳 2.28 至 4.78 个 token,rollout 加速为 1.19 至 2.23 倍。完整训练的加速范围按跨规模表格计算是 1.16 至 1.88 倍,并非摘要容易让人理解的统一 1.50 至 1.88 倍。

在 Qwen3-8B 的单轮任务中,EAGLE-3、DFlash 和 DSpark 分别带来 1.50、1.88 和 1.83 倍端到端加速。更大的模型不一定获益更多:表中 Nemotron-3.5-Lightning-30B-A3B 只有 1.16 倍,GPT-OSS-120B 为 1.19 倍。论文认为,稀疏路由带来的专家计算,以及某些模型较便宜的验证步骤,会限制推测解码的相对收益。

多轮 Workplace Assistant 任务更能说明瓶颈转移。它包含模型多次回答、工具调用和环境等待。这里 rollout 加速达到 1.75 至 2.23 倍,端到端训练却只有 1.25 至 1.43 倍,因为 rollout 只占每步总时间的 55.8%,工具和环境延迟不会随着解码变快而消失。速记员写得再快,也不能缩短等待外部回复的时间。

作者还比较了学习过程。三种在线共训草稿在 reward(奖励)、validation accuracy(验证准确率)和 training–inference KL divergence 上,都与不使用推测解码的基线呈现接近轨迹。最后一项衡量训练端与推理端在相同权重下给出概率分布的一致程度。现有结果因此没有显示出明显的学习偏移,但“接近”仍是作者基于自身曲线作出的判断。

长上下文才是系统设计的主场

在最长 20,480 token 的变长 EAGLE-3 测试中,packed zigzag-ring attention 相对最佳 USP 配置,在 CP 为 2、4、8 时分别改善注意力算子的延迟 2.9、2.3 和 1.5 倍,并把每块 GPU 的峰值显存降到原来的约三分之一,即降低 2.7 倍。这里比较的是特定 attention operator,不等于整套 RL 训练获得同等加速。

在固定 256K token 的测试中,CP 从 1 扩展到 8 后,延迟由 17.7 秒降至 2.35 秒,相当于 7.5 倍扩展、94% 并行效率;每块 GPU 的显存从 53.2 GB 降到 7.5 GB。这说明该设计至少在作者的配置下能把极长序列摊到更多设备上,而不会被分支注意力卡住。

为什么值得关注

这项工作的价值,不只是又做了一个更准的草稿模型。它改变的是系统边界:草稿不再是 rollout 服务旁边一个固定附件,而成为随 RL 策略一起更新的训练成员。作者尽量保留主模型已有的 CP 和 PP 拓扑,再用分拆式分支注意力与侧路传输补上缺口。对于长上下文 RL,这比单独提高某个模块的吞吐更接近真正的端到端问题。

它也提醒我们,加速不能只看最亮眼的局部数字。生成快了多少,最终要乘上生成在整步训练中所占的比例;工具等待、草稿训练开销和模型结构都会吃掉收益。论文把这些损耗放进了同一套实验,因而比单报 rollout 吞吐更有参考价值。

局限与未知

  • 所有效果均由作者自行测得,且依赖模型、草稿、H100 或 GB200 GPU、并行配置、上下文长度和任务,尚不能视为可普遍复现的固定收益。
  • 跨规模端到端加速最低为 1.16 倍;摘要中的 1.50 至 1.88 倍更符合 Qwen3-8B 三种草稿的结果,不能外推到全部模型。
  • 论文给出的代码入口是 NVIDIA-NeMo/RL 的 GitHub issue #3698,更准确地说是实现跟踪入口,不能据此断言已经发布独立归档、固定版本的完整复现代码。

供稿材料 SOURCES — 1

← 返回 2026-09-10 · 学术板块