Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 35 约 1 分钟

扩散语言模型服务有了硬件账本

实测发现,扩散语言模型的并行优势,关键不只在GPU算得快,更在于能否把请求合成一批。

让一群人同时点餐,后厨能一次做十六份,不等于整家店就快十六倍:接单、传菜也会耗时。掩码扩散语言模型也是如此。它先放下一批空缺,再多轮“去噪”——逐步把空缺修成文字,理论上能同时处理多个 Token(文本的基本单位)。这篇论文追问的是:放进多人同时使用的真实服务环境后,这种并行生成还快不快。

作者在单张 NVIDIA H200 GPU 上测试 LLaDA-8B-Instruct。最值得注意的结果是,单请求总耗时中只有 24% 来自 GPU 计算,其余 76% 是 CPU 侧发起计算任务的调度开销。于是,批处理的主要价值不是让 GPU 本身算得更快,而是让多个请求共用每轮去噪的一次计算调用;与逐请求分别调用相比,批量为 16 时,作者测得吞吐量提高 16.0 倍。

这也给“扩散模型天然更适合并行”加了一本硬件账:优势能否兑现,取决于服务系统能否在每轮去噪时共享计算,而不能照搬自回归模型——像接龙一样逐字生成——的调度方式。结论目前来自单卡、单租户设置,多租户争抢资源和多 GPU 场景尚未测量。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 学术板块