好比一个人只会模仿熟悉演员的动作:演员一换,即使关节活动方式相近,他也可能接不上。XEWorld追问的正是这个问题:动作条件世界模型——根据当前画面和机器人将执行的动作,预测后续画面——能否把学到的规律用到从未见过的机器人身体上。这关系到模型是在理解运动,还是只记住了熟悉的外观。
作者在五种双臂机器人、25项操作任务上构建受控测试:场景布局、物体位置、光照和相机保持一致,只替换机器人的具身形态,也就是机械结构与外观。最值得注意的结果是,生成误差与机器人外观距训练样本有多远强相关,却与物理运动学差异只有微弱且不稳定的关系。换句话说,现有模型更像二维画面匹配器;身体看着陌生,即使运动结构并不更陌生,也容易失手。
作者还称,静态参考图或未对齐的动作片段几乎没有帮助;零样本迁移需要像素空间动作和明确的时空对齐。少量新机器人数据虽能帮助恢复外观,却会让模型严重遗忘旧机器人。这说明跨身体泛化仍不是换张参考图就能解决的问题。