Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.063 — 2026-09-05
PAPER 约 1 分钟

RLVR的裁判到底错在哪里

自动裁判会被句号和换行骗过,模型进步与榜单成绩都可能掺入判分偏差。

同一道数学题,答案末尾多一个句号,自动裁判就可能从“对”改判成“错”。这不只影响榜单:RLVR(可验证奖励强化学习)会把裁判给出的通过或不通过直接用于训练,因此一次解析失误,既可能压低评测成绩,也可能教偏模型。

Esther Xin 把蜕变测试用在裁判而非模型上:将标准答案改写成数学意义不变的形式,再看验证器是否改判。论文审计了四种常用验证器、43 种变换,共得到 307,420 次判定。作者报告,同一批等价答案的通过率从 53.8% 到 95.2%,相差 41.3 个百分点;同一套程序的两种配置,对近一半答案给出了不同判断。

最值得注意的是,问题未必出在高深的数学解析。默认 LaTeX 配置中,93.0% 的合约范围内失败来自空白与标点,末尾句号或换行就占了主要部分。换句话说,当训练奖励和榜单共用验证器时,所谓“模型进步”也可能混入裁判配置的差异。论文的分类审计让这部分偏差第一次可以被逐项定位。


供稿材料 SOURCES — 1

← 返回 2026-09-05 · 学术板块