Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER 约 1 分钟

多语言RLVR卡在奖励裁判

数学答案相同,换种语言和写法却可能被判错,进而把偏差喂回训练。

同一道数学题,AI 用英文写“12”,换成日文字符、全角数字或带后缀的“12”,自动裁判可能只认前一种。问题不只是测评分数不好看:RLVR(用可自动核验的结果训练模型的强化学习)会把裁判的对错判断当作奖励,因此,答对却被判错的“假阴性”会直接影响哪些回答和推理轨迹得到强化。

Zhou、Jiang 和 Xu Zhou 检查了 Qwen3-4B、Qwen3-8B 与 Llama-3.1-8B-Instruct 在 MGSM 英文、日文和中文数学题上的输出。他们发现,严格字符串匹配造成的误判率随语言明显变化,而且最吃亏的语言取决于模型的输出习惯,并非测试集固定如此。最关键的诊断是:当最终答案统一成普通数字格式后,精确匹配带来的语言偏差降为零,但各语言原有的准确率差距没有变化。换句话说,这部分差异来自“答案怎么写”,不是“题会不会做”。这值得警惕:若训练前不按语言审计答案验证器,系统可能把排版和字符差异误当成能力差异,并在筛选训练轨迹时悄悄放大它。


供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块