Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.041 — 2026-08-14
PAPER H 36 约 1 分钟

软最大优势,重分配GRPO学习信号

用Softmax重分配GRPO学习信号,少在简单题上用力

像老师批改练习:学生已经稳定答对的题,不该继续占用最多辅导时间。GRPO——让模型对同一道题生成一组答案,再按组内相对表现学习——在只有“对/错”的二元奖励下,却可能把过多学习力度分给接近做会的简单题,挤压真正需要改进的题目。

SoftmaxGRPO替换了其中一步:它先用带温度的Softmax把奖励换成组内权重,再减去均匀基线,得到总和为零、范围有界的“优势值”——也就是每个回答该被鼓励或压低多少。温度决定信号多集中于正确答案。关键在于,无论题目多简单,这种权重都不会无限增大;而且它可以直接替换GRPO原有的标准化方式。

作者称,在奖励相同的对照中,该方法确实把梯度预算从接近解决的题目移开,并优于GRPO;例如让一个1.5B指令模型在Poetry任务上从35.0%升至68.0%,仅使用轻量文本相似度奖励。不过,这些效果目前来自论文作者报告。


供稿材料 SOURCES — 1

← 返回 2026-08-14 · 学术板块