让一群人同时点餐,后厨能一次做十六份,不等于整家店就快十六倍:接单、传菜也会耗时。掩码扩散语言模型也是如此。它先放下一批空缺,再多轮“去噪”——逐步把空缺修成文字,理论上能同时处理多个 Token(文本的基本单位)。这篇论文追问的是:放进多人同时使用的真实服务环境后,这种并行生成还快不快。
作者在单张 NVIDIA H200 GPU 上测试 LLaDA-8B-Instruct。最值得注意的结果是,单请求总耗时中只有 24% 来自 GPU 计算,其余 76% 是 CPU 侧发起计算任务的调度开销。于是,批处理的主要价值不是让 GPU 本身算得更快,而是让多个请求共用每轮去噪的一次计算调用;与逐请求分别调用相比,批量为 16 时,作者测得吞吐量提高 16.0 倍。
这也给“扩散模型天然更适合并行”加了一本硬件账:优势能否兑现,取决于服务系统能否在每轮去噪时共享计算,而不能照搬自回归模型——像接龙一样逐字生成——的调度方式。结论目前来自单卡、单租户设置,多租户争抢资源和多 GPU 场景尚未测量。