像老师给一整篇解题过程的每一步都贴上同一个最终分数,学生很可能学不会哪一步真正改变了结果。PPO——一种限制策略更新幅度的强化学习方法——也可能遇到类似问题:它的价值网络(Critic)本应估计“从这里继续,最后能拿多少分”,为模型指出哪些中间选择更好;但论文发现,它给出的分数常常近乎一条平线。
研究者从同一中间状态采样多条续写,用最终奖励估算真实成功率。这个 Monte Carlo 估值会随推理进程明显跳动,Critic 的预测却变化很小,偶尔甚至方向相反。作者把它称为“价值扁平化”。其解释是:当任务只在结尾给奖励时,标准训练会把同一个结果反复用于每个 token;均方误差损失由此隐含地压低各位置之间的价值差异。相邻状态又只差一个 token,产生大量相似、重复的更新,进一步磨平预测。
论文提出稀疏版 PPO:每条回答只挑少数、彼此相隔较远的状态训练 Critic。作者称,仅监督三个状态,就能在 Qwen3-4B-Base 和 Qwen3-8B-Base 的数学及分布外推理评测中缓解扁平化,并持续改善策略表现。关键提醒是:监督点更多未必更精细,反而可能让 PPO 最重要的判断信号变钝。