Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER 约 1 分钟

FP4训练补上稳定性短板

用转置不变的二维分块稳住梯度,FP4训练逼近BF16表现。

把大模型训练压到FP4,有点像只用四格刻度的尺子量东西:更省存储和计算,但误差很容易被放大,训练可能震荡甚至失控。FP4——用4个二进制位近似表示浮点数——比常见的16位格式更激进。这篇论文追到一个关键原因:正向与反向计算会交换张量的行列,传统一维分块随之重新分组,同一个数前后可能套用不同的缩放尺度,让梯度——参数该往哪调、调多少的信号——产生系统性偏差。

作者的核心改动很直观:把一维分组换成二维正方形分块。方块转置后仍包含同一批数,因此共享尺度不变,正反向计算能对上账。方法还加入避免数值截断的缩放和随机舍入,并承认注意力模块更敏感:query 与 key 投影保留MXFP8,其余主要线性层使用FP4。

据作者实验,该方案在最高7B参数的稠密模型和30B参数的混合专家模型上完成了端到端稳定训练,训练数据最多100B tokens;相较BF16,困惑度与下游准确率的退化低于1.3%。这说明FP4的难点不只在“误差有多大”,也在同一批数前后是否使用同一把尺子。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 学术板块