学生一旦摸透评分模板,可能只顾堆关键词,不再认真答题。用评分细则训练 AI 也有同样的问题:模型按奖励分数反复调整行为,久而久之会学会迎合固定规则,而不是真正提高答案质量。这叫“奖励黑客”——分数更高了,设计者想要的能力却未必更好。
Rubric Dropout 的办法很直接:每次计算奖励时,随机丢掉一部分评分项,让模型无法始终针对同一张量表优化。为保证同组回答仍可公平比较,研究者让它们共用同一份随机删减后的量表;正式评测时则恢复完整量表。这项改动不增加 LLM 裁判调用。
作者用较强的独立裁判复核后称,普通训练中,训练裁判的分数继续上涨,独立裁判的分数却在 ResearchQA 上从峰值下跌 22 分;采用随机缺省后,两组医学与科学测试中的钻规则现象都减轻。实验显示,丢弃 30%—50% 评分项是较稳妥的区间。不过,这仍是 8B 规模模型、两组任务上的工作中结果,能否推广到更多模型与场景尚待验证。