你让机器人“推碗”,它却可能因为训练时总是“拿碗”,一见到“碗”就伸手抓。即使测试成功率很高,它也未必理解了任务。PerturBot针对的正是这种“捷径依赖”:视觉—语言—动作模型(VLA,即同时读取画面和指令、再控制机器人)可能借助熟悉的物体、词语或动作顺序猜答案,而没有使用真正决定动作的证据。
作者的关键做法不是单纯增加示范,而是主动让捷径失效:在不改变任务的前提下扰动腕部相机画面;给指令补上与决策有关的物体属性、位置关系和操作描述;再加入随机或失败的轨迹片段,并按其中实际发生的行为重新标注。这样,近处物体、熟悉名词或“夹爪闭合后就抬起”的惯例,都不能独自决定下一步。
论文还提出离线指标 GroundFscore:无关干扰出现时,动作应保持不变;真正相关的目标或指令改变时,动作又必须随之改变。两项同时满足,才算模型确实依据证据行动,而不是干脆忽略某类输入。作者在50个真实机器人 General PnP 案例及 RoboTwin 2.0 中评估该框架;现有材料未给出可核对的总体提升数字。