让 AI 先用便宜的方法猜一段答案,再交给原模型一次核验,猜对的整段放行——这就是投机解码,结果仍与原模型逐字生成一致。问题在于,聊天像即兴对话,下一句话选择很多;代码和数学则更有固定结构。同一种“草稿”方式,很难在两类请求上都省时间。AngelSpec 的价值,正是把这种流量差异当成设计前提。
它为聊天采用多词元预测(MTP,一次试猜后面多个词元),候选较短,避免猜得太远;为代码和数学采用 DFly,以块并行扩散解码一次铺开较长候选,再反复修正。系统还会根据每段草稿的可信度、当前负载和实测运行成本,动态决定核验多深:空闲时多看几步,拥挤时尽早剪掉低价值后缀。作者报告称,在 Hy3-A21B 上,DFly 在测试的 4 至 64 并发范围内均取得最高平均吞吐量;原文抓取材料中的具体加速数字缺失,因此不宜进一步量化。