Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
PAPER HF 6 约 1 分钟

MoE优化器状态也要分层住

SkewAdam按参数角色分配优化器状态,让6.78B MoE训练装进40 GB显存。

训练大模型像搬家:常用物品放手边,偶尔才用的没必要都占最贵的柜子。混合专家模型(MoE)每次只调用少数“专家”子网络,但训练时仍要给全部参数保存优化器状态——记录近期更新方向和波动大小的账本。论文测试的6.78B参数模型中,AdamW为12.6 GB权重配了50.6 GB状态,训练峰值内存达到81.4 GB。

SkewAdam不再一视同仁。它让每次都会运行的稠密骨干保留动量和压缩后的二阶统计;占参数95%的专家只留压缩统计;负责分派输入的路由器虽小,却保留精确统计。作者报告,优化器状态因此降至1.29 GB,即AdamW的2.6%,峰值内存降至31.3 GB,可放进40 GB加速器。相同初始化、训练8200万词元时,SkewAdam的验证困惑度为108.4(越低通常越好),AdamW为126.8。消融实验也提示,分层主要负责省内存,成绩优势来自保留动量;这些结果仍限于论文所述的受控实验。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 学术板块