Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 31 · HF 8 约 1 分钟

FP8开始覆盖LLM强化学习全管线

FP8贯穿LLM强化学习全管线,新校准方法试图兼顾省算力与训练稳定

给大模型做强化学习,像让学生一边答题、一边根据得分改进;但如果把整套流程都换成更省显存、搬运更快的FP8——一种8位浮点格式——细小的计算误差也会沿管线叠加。论文发现,问题不只在生成答案和训练更新之间的概率对不上:训练中途还可能出现熵异常飙升,也就是模型的选择突然变得过于随机,随后产出乱码。

作者把原因追到“重要性比率”——用来衡量新旧策略概率变化的数值。FP8噪声会扭曲它,让更多负优势词元(效果较差、本应被压低概率的选择)越过允许的更新范围,梯度被错误清零。坏输出因此没有受到惩罚,反而逐步积累。为此,论文提出 Calibrated Clipping:参照高精度BF16的分布,动态校准FP8的裁剪边界。作者称,该方法在GRPO、DAPO两种强化学习算法、8B至32B模型及多种FP8缩放粒度下消除了熵飙升,并恢复到接近BF16基线的表现;这些效果目前来自论文自述。


供稿材料 SOURCES — 1
01
Towards Full Pipeline FP8 Reinforcement Learning for LLMs arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-26 · 学术板块