你让 AI 写一封长邮件,它通常会从第一个词开始,一个接一个往后续。前面的词没出来,后面的词就不能动。这种“逐词等待”并不总能被更快的芯片消除,因为生成过程本身就是一条接龙。DiffusionGemma 想换一种写法:先摊开一整块未完成的草稿,同时处理许多位置,再经过多轮校订得到成文。它没有一次生成完整答案,但把文本生成从严格串行,改成了可以并行推进。
这是 Gemma 家族对离散扩散语言模型的一次明确押注。所谓离散扩散,是从被遮盖或扰乱的文本出发,反复修改,逐渐恢复完整内容。DiffusionGemma 团队在技术报告中称,模型由 Gemma 4 微调而来,在单张 NVIDIA H100 GPU 上可达到约 1,500 个输出词元每秒。不过,目前所有方法与效果数据都来自团队自己的技术报告,尚无供稿材料所载的第三方复现。
不再接龙,而是集体改稿
多数常见语言模型采用自回归生成。它们每次根据前文预测下一个词元,再把新词元接回前文,继续预测。词元(token)是模型处理文字的基本小块,可能是一个字、词的一部分,也可能是标点。由于下一步依赖上一步,许多位置无法同时生成。
DiffusionGemma 不按单个词元依次解码。它一次面对一个包含 256 个词元的文本块,并行修改其中多个位置。这里的“256 tokens”不等于 256 个汉字或单词,只表示模型内部处理的文本块大小。
可以把两种方法想成两种写稿方式。自回归模型像一个人从标题开始,一句话一句话往下写;离散扩散模型则像先拿到一页布满空缺和草稿痕迹的文档,多个人同时填写不同位置,然后反复通读和修改。并行的价值正在这里:一次计算不必只推进一个位置。
但“告别逐词等待”并不等于“一步出全文”。DiffusionGemma 仍要经过多轮迭代,把文本块逐渐细化。技术报告给出的全套评测平均值是:每次前向计算,也就是模型完成一次从输入到输出的计算,约生成 20 个词元。这是跨评测的平均结果,不代表每一步都会固定产出 20 个已经定稿的词元。
从现成模型改造,而非重新训练
DiffusionGemma 不是从零训练。团队以 Gemma 4 为起点,通过两阶段微调改变它的生成方式。Gemma 4 是混合专家模型(Mixture-of-Experts,MoE):模型内部有多个“专家”子网络,每次只调用其中一部分,像把任务分派给少数专科组。因此,它共有 25.2B 参数,但每次计算激活的是 3.8B 参数。
第一阶段采用监督微调,让模型学习“双向去噪”。简单说,它不能只看左边已经写好的内容,还要结合文本块中不同位置的信息,把受扰乱的草稿修复出来。
第二阶段把强化学习与 sampler distillation 结合起来。强化学习让模型根据结果反馈调整生成策略;sampler distillation 可理解为把较复杂的采样过程压缩、传授给更高效的生成过程。团队称,这一步同时改善生成质量和推理效率。不过,供稿摘录没有披露两者各自贡献了多少,也没有提供消融实验数字。
这套两阶段训练使用的词元数量,少于起始自回归模型总训练词元预算的 10%。这个数字容易被误读:它只比较训练中处理过的词元数量,不能直接推导出算力、成本或训练时间减少了 90%。但它仍说明了一件重要的事:团队尝试把一个已有的自回归基础模型改造成扩散模型,而不是为新路线重新支付完整的预训练代价。
速度承诺到了可以测量的层面
技术报告称,DiffusionGemma 在完整评测套件上平均每次前向计算生成约 20 个词元,并在单张 NVIDIA H100 GPU 上达到约 1,500 个输出词元每秒。团队还称,它比采用顶尖推测解码的自回归模型更快。推测解码是一类加速办法:先快速猜出若干后续词元,再由模型检查,从而减少逐个生成的等待。
报告用“新的 Pareto frontier”概括结果。Pareto frontier 指的是:在速度与能力这两个互相牵制的目标之间,模型给出了一组此前难以同时达到的组合。换句话说,团队认为 DiffusionGemma 不只是单纯追求速度,而是在相近能力下更快,或在相近速度下能力更强。
这仍是团队自评,不是行业已经确认的结论。特别是 1,500 tokens/s 这个醒目的数字,在供稿摘录中没有附带精度、批量大小、序列长度、采样步数、软件栈和对照模型配置。缺少这些条件,跨模型速度比较很容易失真。
为什么这条分叉值得看
真正值得关注的,不只是一个吞吐数字,而是生成范式的变化。自回归模型把“下一个词”当作基本动作;DiffusionGemma 把“一块文本的多轮修订”变成基本动作。前者天然串行,后者为并行更新留下空间。如果这条路线经得起独立测试,语言模型的工程竞争就不再只是让逐词接龙跑得更快,也可以重新设计生成过程本身。
它还保留了一条回头路。团队报告称,DiffusionGemma 仍支持起始模型的 thinking mode、多模态输入和长上下文。thinking mode 指模型在作答前进行更充分的中间推理;多模态输入指除文字外还能接收其他类型的信息;长上下文则意味着可以处理更长的输入。报告还称,经过扩散微调后,模型依然能够使用传统的自回归方式生成,性能只轻微下降。
这使“混合解码”成为一个值得观察的方向:同一模型可能根据任务,在扩散式并行修改和自回归逐步生成之间选择。但供稿材料只说这条路径“有可能”,没有给出具体切换机制或分项结果,因此目前更适合把它看作技术线索,而非成熟能力。
开放权重也值得单独说清。它意味着模型权重可以获得和使用,但不自动等于完整开源。仅凭现有材料,不能推断训练数据、训练代码和全部训练流程都已经公开。
局限与未知
- 所有结果都来自 DiffusionGemma 团队的单一技术报告,目前缺少第三方复现和独立基准验证。
- 约 1,500 output tokens/s 的测试条件披露不足;“更快”和“新的 Pareto frontier”仍属于团队结论,不能直接推广到所有部署场景。
- 摘录没有给出 thinking mode、多模态、长上下文及自回归生成的分项数字,也没有展示两阶段训练各环节的独立贡献。