Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.085 — 2026-09-27
PAPER 约 1 分钟

并行草稿也能藏进解码流水线

DPara把草稿生成的重活与主模型验证并行,避免猜错后退回串行。

像厨房里一道菜还在烤,厨师已经开始备下一道:AI 生成文字也能这样压缩等待。推测解码先让较便宜的草稿模型猜一串 token(文字的基本单位),再由主模型批量检查;问题是,下一轮草稿通常要等检查结束才能开工,仍卡在决定总耗时的关键路径上。

DPara 的巧处,是不再提前猜主模型会接受到哪里、又会补上哪个 token。验证进行时,它让较耗时的 diffusion backbone(负责生成草稿中间表示的主干网络)为每一种可能的接受边界预先计算;结果揭晓后,再由轻量的自回归头选中对应表示,并结合实际补充 token,几乎立刻产出下一轮草稿。这样,主干计算每轮都能藏进验证时间里,也不会因猜错而整批退回串行。

作者在 Qwen3-8B 和 Qwen3-14B、七个数学、编程与聊天基准上报告,DPara 均超过所比较的串行及并行方案。不过供稿文本缺失了具体加速数字,因此这里只保留方法与比较结论。


供稿材料 SOURCES — 1
01
When Parallel Drafter Meets Parallel Speculative Decoding arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-27 · 学术板块