Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.068 — 2026-09-10
PAPER H 12 约 1 分钟

机器人奖励模型会被改写指令骗过

同一段机器人动作,只换指令说法,部分模型就会把失败改判为成功。

就像裁判看了同一段比赛录像,只因提问换了说法,便给出相反判决。机器人训练也可能遇到这种问题:视觉语言模型(VLM,能同时理解画面与文字指令的模型)常被当作奖励模型——给机器人的动作过程打分,指导它通过强化学习反复试错。但如果分数跟措辞走,机器人学到的方向也会被带偏。

研究者为此制作了 RoboRMBench:固定同一条真实机器人轨迹,只改写目标指令。基准包含 2,390 条轨迹和 21,673 条经语义等价验证的改写,覆盖换词、调整句式和转换行动目标的叙述视角。论文报告,在视角转换幅度较大的测试中,一些通用 VLM 对超过半数轨迹同时给出过“失败级”和“成功级”评分。模型更大或加入显式推理,也没有稳定消除矛盾。

相较之下,接受过“轨迹—奖励”专门监督的 RR-4B、RR-8B 虽然更小,却明显更稳定。作者还发现,在离线挑选最佳轨迹时,措辞矛盾较少的模型能选出真实进度更高的动作。这说明,机器人奖励模型不只要平均打得准,还得做到同义指令不改判。


供稿材料 SOURCES — 1

← 返回 2026-09-10 · 学术板块