让 AI 写长回答时,它通常要一个词一个词往后生成,后一步必须等前一步完成。DFlash想减少这种排队:先由较小的“草稿模型”一次猜出一组token(文本片段),再让目标模型批量核验;猜中的连续片段直接采用,猜错则回退,因此不改变目标模型原本的输出分布。
DFlash的关键是,草稿模型不再逐个猜,而是用block diffusion一次预测整块内容;同时把目标模型的隐藏特征注入草稿模型的KV Cache——可理解为生成时暂存上下文信息的“草稿纸”——以提高命中率。作者在vLLM运行Qwen3.5-9B的CPU测试中报告,生成吞吐接近4倍;但作者供职于Intel,结果尚需独立核查。
这说明投机解码的价值不只在GPU服务。CPU低并发生成常受内存搬运拖累,批量核验可以让一次读取的模型参数服务多个候选位置。不过收益取决于猜测命中率、核验开销和并发量;代码、数学等结构化任务通常更容易猜中,领域与提示不匹配时,提速可能很有限。