等 AI 从长文里摘录原句,通常还要逐字生成;如果它能直接从眼前的文档中“续写”,等待时间就可能大幅缩短。开发者 iamMess 自述,其 Qwen3.8-27B 推理引擎在单张 RTX 3090 上处理文档引用任务时,单请求速度已从此前的 82 tok/s 提高到约 382 tok/s。tok/s 指模型每秒产出的 token 数,单请求速度更接近一个用户实际等待回复的体感。
关键变化是把 DFlash2 草稿与查找增强草稿结合起来:前者先猜一小段文字,后者再从当前文档中寻找已有片段,补满更长的候选块,最后交给主模型一次核验 16 个 token。在复现一篇 2.5 万 token 文档时,每轮平均接受 15 个,速度由 260 升至 382 tok/s;普通聊天只提升约 9%。
这不是所有场景都能获得的通用加速。作者称,该模式在复现上下文时提升 53%,其他任务仍约比普通 MTP 慢一倍,首个 token 的等待时间也翻倍,因此更适合 RAG 文档问答和按原文修改代码。作者还更正了此前长上下文测试口径:旧表格使用了未启用推测解码的批处理配置,112k 上下文的单用户 KVarN 解码开销实际为 2.13 倍。