Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER H 2 约 1 分钟

FP8训练补上注意力最后一道裂缝

Delta-Matching校准注意力的前反向误差,补上原生FP8训练的关键缺口。

像拿着一张被反复复印的草稿改作文:每次偏一点,短篇看不出来,写得越长,修改方向越容易跑偏。FP8训练也有类似问题。FP8用8位浮点数表示数值,能节省显存、提高计算效率,但精度较低。注意力模块前向计算答案、反向追查参数该怎么改时,如果两边各自舍入,依据的数值便可能不一致,产生“陈旧更新”(stale delta)。

Delta-Matching的关键,是用量化前的FP32注意力概率,以及FP8反向操作数形成的FP32乘积,重新对齐这项修正。作者证明,在其数值假设下,它能恢复softmax梯度每行之和为零这一稳定性质,并让注意力前后向的核心矩阵乘法都采用分块缩放FP8,无须改模型架构或额外保存前向输出。

这个问题会被小实验掩盖:作者报告,陈旧更新在5.69亿参数模型上只留下较小损失差距,但到16.7亿和52.9亿参数时,误差会累积并拖累下游表现;一次从8K扩到64K上下文的训练中,差距约到1.9万步、200亿词元后才明显出现。按论文结果,Delta-Matching在所测架构、规模和训练阶段中匹配了BF16/FP32混合精度的训练损失与总体下游表现;实现、模型和数据配方尚待作者公开。


供稿材料 SOURCES — 1

← 返回 2026-10-03 · 学术板块