把 AI 模型做大,像给一家医院扩建:是多开专科、增加接诊量,还是让每位病人接受更多检查?这篇论文研究的正是扩散语言模型(dLLM)如何分配新增算力。它不按从左到右逐词接龙,而是多轮并行修订被遮盖的文本;再配上 Mixture-of-Experts(MoE)——让每个词元只调用少数“专家”子网络,以较少的单次计算承载更多参数。
团队用 IsoFLOP 分析,也就是在相同计算预算下比较模型大小与训练数据的不同组合。结果显示,扩容时最优配方略向数据侧倾斜:训练词元量的增长应快于每个词元实际调用的模型计算量。规模越大,也越适合在调用量不变时准备更多专家,而不是让每个词元同时动用更多专家。
研究者据此从头训练了 LLaDA MoE v2:总参数量 30B,每次激活约 3B,并使用 23.5T 个词元。作者称,它只用了约 Qwen3 预训练词元量的 65%,便在若干知识、推理和编程基准上接近后者。这还不能证明扩散路线已经追上自回归模型,但至少补上了一组关键证据:它的规模化配方可以测量,而且不能直接照搬自回归模型的经验。