Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
PAPER H 3 · HF 27 约 1 分钟

扩散MoE也开始认真研究规模化

LLaDA MoE v2摸清扩散语言模型的扩容配方,并用30B模型验证

把 AI 模型做大,像给一家医院扩建:是多开专科、增加接诊量,还是让每位病人接受更多检查?这篇论文研究的正是扩散语言模型(dLLM)如何分配新增算力。它不按从左到右逐词接龙,而是多轮并行修订被遮盖的文本;再配上 Mixture-of-Experts(MoE)——让每个词元只调用少数“专家”子网络,以较少的单次计算承载更多参数。

团队用 IsoFLOP 分析,也就是在相同计算预算下比较模型大小与训练数据的不同组合。结果显示,扩容时最优配方略向数据侧倾斜:训练词元量的增长应快于每个词元实际调用的模型计算量。规模越大,也越适合在调用量不变时准备更多专家,而不是让每个词元同时动用更多专家。

研究者据此从头训练了 LLaDA MoE v2:总参数量 30B,每次激活约 3B,并使用 23.5T 个词元。作者称,它只用了约 Qwen3 预训练词元量的 65%,便在若干知识、推理和编程基准上接近后者。这还不能证明扩散路线已经追上自回归模型,但至少补上了一组关键证据:它的规模化配方可以测量,而且不能直接照搬自回归模型的经验。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 学术板块