Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER H 21 约 8 分钟

Muon为何跑赢Adam

Muon为何比Adam快?论文从不同矩阵方向的步幅分配给出解释,并据此再省13.3%至24.0%训练token。

你带一群人下山,最陡、最滑的那条路只能小步挪;平缓的路却可以大步走。如果领队要求所有人迈同样大小的步子,整队速度就会被最危险的路线拖住。训练大模型也有类似问题:不同参数变化方向能承受的步幅并不一样,但优化器未必把步子分对了。

Xiaodong Wu、Wenyi Yu、Chao Zhang 和 Philip Woodland 的这篇论文,用“谱分配”(Spectral Allocation)解释 Muon 为何可能比 Adam 更快。这里的优化器,是训练中决定参数往哪里走、每次走多远的规则;谱分配则把一层参数的更新看成矩阵,追问步幅是否合理地分给了矩阵中不同的主要变化方向。

论文的核心判断是:Transformer 的训练地形并不均匀。少数最强方向很敏感,只容得下小步;大量其余方向更宽容,可以走得大得多。Muon 比 Adam 更接近这种需求,但仍然过于保守。作者据此提出 SAMuon,在不放大敏感方向的前提下,专门给宽容方向加速。

本文所有机制、效率和实验结论均来自该论文,尚无第二个独立信源交叉验证。

先找出每条路能走多快

Adam 是常见的大模型训练基线。它根据每个参数近期梯度的一阶矩和梯度平方的二阶矩,分别调整更新方向与步幅。Muon 换了一个观察尺度:它把一层的更新当作矩阵,并“白化”动量梯度——重新整理不同方向的强弱,让各个非零奇异方向获得近似统一的更新尺度。奇异方向,可以理解为这个矩阵中彼此独立的主要变化路线。

问题在于,统一分配为什么有效,又为什么仍不够好?作者做了“样本外谱探测”。他们在真实训练轨迹的多个检查点取出动量缓冲区——优化器积累近期更新趋势的记录——把它分解成各个奇异方向,再用与形成更新不同的留出批次,估计每个方向令损失最低的步长。这样测的是一次更新对未见数据的作用,而不是它对当前梯度批次的贴合程度。

完整逐方向搜索代价太高。论文因此用局部二次近似,把每个方向附近的损失看成一段抛物线,再估计最低点。探测结果显示出一个稳定但高度不均匀的谱结构:最前面的“波动 head”承载了大部分梯度信号,却只能接受很小的步长;其余“宽容 bulk”大体平坦,允许的步长可达 head 的数倍。这个形状在不同批次、训练阶段、优化器和模型规模下都较稳定。

head 还处在 Edge-of-Stability——也就是训练恰好贴着稳定边缘运行。Muon 的实际尺度与它能承受的步长相近,因此只要再整体加大学习率,head 就可能先失稳。它像整队里走在险路上的那个人,限制了所有人的统一步幅。

Muon赢在把力气重新分了

从这个角度看,SGD、Adam 和 Muon 的差别可以放在同一条轴上比较。

带动量的 SGD 会按奇异值大小分配更新。信号越强的方向,步子越大。可论文测到的训练地形恰好相反:最强的 head 最敏感,宽容的 bulk 反而适合大步。于是 SGD 把大量更新压在最不稳定的方向上。

Adam 按单个参数缩放更新,能削弱这种失配,因此论文用它解释 Adam 为何优于 SGD。但 Adam 并不知道矩阵中的完整谱结构。投影到动量缓冲区的奇异方向后,它虽然相对抬高了 bulk,head 仍占主导。

Muon 的处理更直接。白化把各个奇异方向拉到近似统一尺度,相当于从强势 head 手里挪出一部分更新额度,分给此前被忽视的 bulk。这正好顺着论文测得的地形走,因此作者提出:这种谱重分配,是 Muon 跑赢 Adam 的一个机制解释。

但这还不是定论。它是这篇论文提出并用自身探测与实验支持的解释,不是经独立研究确认的共识,也未证明它是唯一机制。

不让险路加速,只让平路迈大步

Muon 的局限也随之变得清楚:它把所有方向拉到同一尺度,而这个尺度仍由敏感的 head 决定。bulk 明明还能走得更远,却只能陪着 head 小步移动。

SAMuon 的关键做法很克制。它保留 Muon 的动量与白化,把 head 固定在原来的 Muon 尺度,只放大 bulk。完整版本使用低秩随机化 SVD——只估计少量主要奇异方向的矩阵分解——让更新尺度随谱排名逐渐上升,贴近探测到的“对数排名近似线性”形状。SAMuon-lite 更简化:用 rank-one power iteration 估计最主要的一个方向,然后采用两档步幅,head 一档,整个 bulk 一档。

这种差异不会从训练第一步就完全打开。论文发现,head 与 bulk 的容忍度差距在最初几百步逐渐形成。因此两种方法都从普通 Muon 起步,再通过 warmup——逐步增加调整强度的预热过程——慢慢启用谱塑形。

两者都只保留 Muon 原有的一份动量缓冲区,不增加持久化 optimizer state。论文称,大规模训练下额外 FLOPs——浮点运算量——并不显著。理论分析也表明,在理想化的精确白化和标准假设下,两种方法保持 Muon 的渐近收敛阶。

不过,低 FLOPs 不等于同样低的实际耗时。论文正文指出,当前 torch.svd_lowrank 实现使完整 SAMuon 的额外运行时间接近 Newton–Schulz 白化本身;后者是 Muon 用矩阵乘法近似白化的计算过程。SAMuon-lite 的 power iteration 则只需少量矩阵—向量乘法,其 wall-clock overhead 接近零。也就是说,lite 版本目前更接近“低成本升级”。

省下的是token,不是训练时间

作者在 124M、300M 和 1B 参数的 modded-nanogpt 模型上测试,并覆盖 1024 至 4096 的 batch size——每一步共同处理的训练样本数量。按论文报告,SAMuon 和 SAMuon-lite 在所有已评估的模型规模与 batch-size 组合上,都优于调优后的 AdamW 和 Muon 基线;这里的 Muon 特指 Scion implementation,不能泛化为所有实现。

最醒目的数字是:达到与 Muon 相同的 validation loss——在验证数据上衡量预测错误的指标——时,完整 SAMuon 所需 training tokens 减少 13.3% 至 24.0%。SAMuon-lite 保留了大部分收益。

这个口径值得说清。减少的是达到同一验证损失所需的 token 数,不等于训练时间缩短同样比例,也不等于 FLOPs 同幅下降,更不代表最终模型质量提高了 13.3% 至 24.0%。完整版本眼下还有可见的实际运行开销。

为什么值得关注

这项工作的价值,不只在于又做出一个更快的优化器。它把“Muon 为什么有效”变成了一个可以测量的资源分配问题:哪些矩阵方向危险,哪些方向还有余量,优化器又把步幅花在了哪里。

如果这套解释能在更多训练环境中站住脚,后续优化器未必需要堆叠更重的自适应状态。稳定的谱结构或许可以被压缩成简单先验:守住少数敏感方向,同时更充分地利用宽容方向。SAMuon-lite 展示的正是这条路线——只粗略识别 head,也可能拿回大部分收益。

局限与未知

  • 全部证据来自同一篇论文。材料没有提供完整 loss 曲线、随机种子、误差区间、硬件配置及完整 wall-clock 数据,“所有配置均优于基线”和“接近零开销”仍需独立复现。
  • 实验只覆盖 124M 至 1B 参数的 modded-nanogpt、特定 batch size 和 Scion Muon 基线。结果不能外推到其他架构、数据集、更大模型或其他 Muon 实现。
  • 谱探测依赖局部二次近似,理想收益还假设不同方向之间可较干净地组合。真实联合更新存在方向间相互作用,因此测得的 bulk 余量更适合作为设计线索,而不是可直接兑现的精确上限。

供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块