让几个人同时续写一句话,如果每人只管一个位置,单看各自答案都合理,拼起来却可能前后不搭。随机解码正有这个麻烦:模型会按概率抽取词元——也就是文字的基本碎片——因此同一开头可能有多种合理续写。传统的投机解码先让小模型快速猜一组词元,再交给大模型核验;但若组内各位置独立猜测,大模型往往很快否决整段。
DBlast的关键,是让这组草稿先共同选定一条“续写路线”。它引入一个类别变量:先抽取代表某种续写方向的分支,再在该分支内并行生成整个Token块。这样仍保留一次起草多个位置的效率,又让后面的词能与前面的选择相互照应。作者还没有只优化“猜得像不像”,而是直接围绕大模型最终能连续接受多长的草稿来训练。
论文在Qwen3-4B和Qwen3-8B上测试了数学、对话、代码与创意写作任务。作者称,DBlast相较独立采样持续提高了草稿的获准长度,而且生成越随机、候选续写越多,优势越明显。它的意义不在于让答案更大胆,而在于随机生成时,也能把并行猜测组织成一段连贯候选。