让机器人收拾杂货,难点不只是“抓起罐头”:它还得记住已经装了什么、判断下一步,并在抓取失败后改计划。R³研究的是,机器人能否像人一样先用语言多想一会儿,再行动。这里的语言不是电机指令,而是可读的高层草稿;真正控制关节和夹爪的,仍是低层策略。
R³采用两阶段训练。它先让视觉—语言模型(VLM——能同时理解画面和文字的模型)学习专家生成的推理记录,包括任务进度、失误与补救;随后用离线动作数据做单步强化学习——依据指令是否在语义上接近专家选择来给分,继续调整推理方式。这一点很实用:昂贵的完整推理记录只负责“教会怎么想”,更多只有动作指令的数据也能用于后续训练。
作者在 Language Table 和模拟双臂杂货打包环境中测试,并自述 R³在已见与未见任务上优于只模仿指令、不显式推理的基线。更关键的主张是:测试时真正生成推理,比仅把推理当作训练辅助信号更有助于泛化。不过现有证据来自两个受控环境,能否扩展到真实机器人仍未由本文材料证明。