像厨房里一道菜还在烤,厨师已经开始备下一道:AI 生成文字也能这样压缩等待。推测解码先让较便宜的草稿模型猜一串 token(文字的基本单位),再由主模型批量检查;问题是,下一轮草稿通常要等检查结束才能开工,仍卡在决定总耗时的关键路径上。
DPara 的巧处,是不再提前猜主模型会接受到哪里、又会补上哪个 token。验证进行时,它让较耗时的 diffusion backbone(负责生成草稿中间表示的主干网络)为每一种可能的接受边界预先计算;结果揭晓后,再由轻量的自回归头选中对应表示,并结合实际补充 token,几乎立刻产出下一轮草稿。这样,主干计算每轮都能藏进验证时间里,也不会因猜错而整批退回串行。
作者在 Qwen3-8B 和 Qwen3-14B、七个数学、编程与聊天基准上报告,DPara 均超过所比较的串行及并行方案。不过供稿文本缺失了具体加速数字,因此这里只保留方法与比较结论。