像编辑审一段草稿,旧办法只留下通过的开头,后面即使认真批注过,也连同废稿一起扔掉。块扩散推测解码正有类似浪费:较快的模型并行猜出一整块词,再由目标模型一次审核;但遇到首个错误后,系统通常只保留此前通过的词,其余位置下轮重新猜。
DFlow的关键是把“不能采用”和“毫无信息”分开。它保留目标模型审核被拒后缀时产生的隐藏状态——可理解为模型对这些位置形成的内部判断——并送入下一轮并行生成。由于这些信息本来就在验证时算过,作者称此举不增加目标模型的前向计算,也就是不让它额外完整处理一次。团队还用多轮自条件训练,让草稿模型学会利用上一轮留下的信息。
在Qwen3-1.7B、4B和8B的贪心解码实验中,作者报告DFlow相较DFlash将平均接受长度分别提高10.4%、13.2%和13.4%。这说明验证不必只是一次性的裁决,也能成为下一轮草拟的线索;不过这些效果目前来自论文作者的实验。