Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 1 分钟

GRPO开始估计梯度的不确定性

GUPO给每组梯度估算可信度,减少冲突信号对GRPO更新的干扰。

几道题同时给 AI“改作业”时,可能一题让参数往东调,另一题却让它往西调。GRPO(组相对策略优化——让模型为同一道题生成一组答案,再按组内好坏决定如何调整)通常把不同题目的梯度直接平均。梯度就是参数该往哪边微调的导航箭头;箭头互相冲突,训练就可能低效或不稳定。论文观察到,冲突严重的批次往往带来较小的验证集更新收益。

作者提出 GUPO:不再把每组梯度当成完全确定的箭头,而是用贝叶斯方法将其表示为概率分布,再通过基于 Dirichlet 分布的办法估算不确定性。分布越集中,说明方向越可信,汇总时权重就越高;分布越分散,影响便被压低。关键变化很朴素:从“一题一票”改成“更可信的题多说一点”。作者称该方法在多个基准上优于 GRPO,但所给材料未披露具体提升数字。


供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块