你让机器人把杯子放到托盘里。动手前,它先在脑中“预演”一遍:机械臂伸过去,夹住杯子,再平稳放下。画面看起来没问题,它真正执行时却抓偏了。更麻烦的是,只检查这段预演,可能根本看不出危险。
这正是论文《BadWAM: When World-Action Models Dream Right but Act Wrong》追问的问题。世界动作模型(World-Action Model,WAM)一边决定机器人下一步怎么动,一边预测动作之后世界会怎样变化。人们希望预测出的未来能充当行动前的检查,但 Qi Li、Xingyi Yang 和 Xinchao Wang 提出的 BadWAM 显示:在论文的实验设置里,细微的视觉扰动可以让“想象”和“动作”不同步。
这里要谨慎区分两个说法。论文并未证明模型预测的未来客观正确,只说明受攻击后的预测仍可接近未受攻击时的预测。下文数字和效果均来自这篇论文,尚无第三方复现。
真正的漏洞在两条输出之间
普通的对抗攻击,是对输入做细微但有目的的改动,诱使模型给出错误结果,类似稍微改动路标,让导航系统认错方向。BadWAM 攻击的不是一个分类标签,而是机器人控制中的一处接口:模型想象的未来与实际输出的动作是否仍然对得上。
这种错位在具身控制中尤其重要。具身控制指模型通过机器人身体感知并行动。文字答错一句还能重写,机械臂的位置、力度或时机出现小偏差,却可能在连续执行中不断累积。
论文把这类问题称为 World-Action Drift Attack,即“世界—动作漂移攻击”。BadWAM 用两个维度描述它:攻击强度,也就是能把任务破坏到什么程度;隐蔽性,也就是攻击后模型的未来预测与原预测相差多大。
这揭示了一种代理目标错位:容易检查的“未来画面是否合理”,不等于真正关心的“动作是否安全有效”。如果安全模块只看模型的预演,就可能放过一条已与预演脱节的动作指令。
一种猛攻,一种掩住痕迹
BadWAM 提供两种攻击。
第一种是 action-only adversarial attack,也就是只针对动作的对抗攻击。攻击者对摄像头画面加入有界的小扰动,反复查询模型,寻找能让受攻击动作尽量偏离原动作的输入。它不需要专家示范、任务成功标签、模型参数或梯度,只需看到模型输出的动作。
第二种是 imagination-preserving adversarial attack,即保留想象的对抗攻击。它仍要把动作推偏,但同时惩罚未来预测的变化。可以把它理解为给攻击加上一条约束:动作要出问题,模型展示的“预演”却尽量别变得太明显。
两种攻击都采用黑箱查询。BadWAM 在机器人每次重新规划时尝试若干细微扰动,通过比较扰动前后的输出估计更有效的方向,再把扰动限制在规定范围内。默认设置下,每次受攻击的重新规划需要 17 次模型前向查询,其中包含一次干净输入的参考查询。
论文的关键不在于某张图被彻底破坏。攻击会在闭环执行中反复出现:机器人执行一部分动作,看到新的环境,再规划下一步。单次偏差可能还像正常调整,多次偏差却会积累成抓取位置、移动方向或夹爪时机的错误。论文观察到,失败回合通常积累了更大的动作偏移,而未来预测的偏移仍可能保持在较小范围。
数字说明了什么
研究在 LIBERO 和 RoboTwin 两个语言指令驱动的机器人操作基准上测试,并覆盖 action-only、joint 和 IDM 三类 WAM 控制器。前者只输出动作;joint WAM 联合预测动作与未来视觉状态;IDM WAM 先形成未来想象,再从中解码动作。评估采用闭环执行,而不是只比较单步输出。
最醒目的结果来自 LIBERO:action-only WAM 的任务成功率由 96.5% 降到 43.1%,下降 53.4 个百分点。对 joint WAM,成功率从 98.1% 降到 61.5%;加入想象保留约束后为 63.0%。IDM WAM 则从 98.4% 降到 66.1%,想象保留攻击下为 68.1%。后两组结果说明,压低未来预测的变化,并没有自动消除动作攻击。
这并非所有任务同样脆弱。论文报告,action-only WAM 在 LIBERO 的 Spatial、Goal 和 Long-horizon 套件中,成功率分别从 96.5%、97.0% 和 92.5% 降到 16.0%、40.0% 和 23.5%;Object 任务受攻击后仍有 93.0%。作者据此认为,需要精确空间控制或长程连续执行的任务,更容易让小动作偏差累积。
随机噪声也会伤害模型,但弱于定向搜索。在 joint 与 IDM WAM 上,随机扰动后的成功率分别为 71.0% 和 75.2%;BadWAM 的动作攻击则降到 61.5% 和 66.1%。可访问梯度的白箱参考攻击还能进一步降到 49.2% 和 52.8%,但它超出了论文设定的黑箱威胁模型。
想象保留项确实改变了攻击结果。在一组资源相同的比较中,它把平均未来预测距离从 14.01 降到 13.04;40 个 LIBERO 任务里有 39 个任务的预测距离更低,而攻击后的任务成功率仍与纯动作攻击接近。这支持的是“预测更接近干净输出”,不是“预测仍然真实正确”。
为什么值得现在关注
WAM 的吸引力,本来就在于把“会想象后果”与“会采取动作”绑在一起。BadWAM 提醒我们,训练时的耦合不等于部署时牢不可破的同步。未来预测可以帮助规划和解释,但若安全检查只审核未来画面、不核对它与即将执行动作的对应关系,就可能盯错对象。
论文还发现,扰动主要影响连续动作通道和动作序列的后段,并非只把夹爪的开关命令简单翻转。这让问题更像逐渐偏航,而不是突然失控。对安全评估而言,除了看最终是否成功,还要同时记录动作偏移、未来预测偏移,以及两者在整个执行过程中的关系。
局限与未知
- 论文测试的是 LIBERO 与 RoboTwin 中的闭环机器人操作,不能据此断言真实机器人、物理环境或其他攻击者能力设定下会出现同等效果。
- 攻击需要在每次重新规划时多次查询模型。论文称默认攻击每次需要 17 次前向查询;其分析型实现的耗时属于原型成本,并非已经证明可实时部署的攻击。
- “想象被保留”只表示受攻击预测更接近干净预测。论文没有证明两者都符合真实未来,也没有证明单靠这一指标就能骗过所有安全监控机制。