Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
PAPER HF 143 约 1 分钟

奖励学会了,就少分一点梯度

SA-MRPO降低已饱和奖励的权重,把更新信号留给仍有提升空间的能力。

像辅导一个已经会做加法、却还不会乘法的学生:如果两类题仍分到同样多的练习时间,进步自然会慢。多奖励强化学习也有类似问题——它用正确性、格式等多个评分共同训练模型;其中一项目标接近满分后,仍可能持续影响更新,挤压更难目标的学习空间。

作者提出 SA-MRPO。它先分别计算每项目标的优势值——也就是一次回答相对同组回答好多少;再根据一批回答的平均得分占该目标可达范围的比例,估计“奖励饱和”程度。越接近上限,权重越低。这样重新分配梯度——告诉模型参数往哪里、改多少的信号——甚至可能反转一次更新的方向,而不只是减小力度。

据作者实验,SA-MRPO 在数学推理的 15 组基准比较中有 12 组优于 GDPO,主要改善更难的正确性目标,同时大体维持已满足目标;在受控推理的五项基准上也全部提高准确率。论文抓住的重点不是增加奖励,而是让已经学会的目标适时少说一点话。


供稿材料 SOURCES — 1

← 返回 2026-08-21 · 学术板块