同样是“拿起杯子”,换一只手、一个相机或一套控制接口,机器人就可能不会做了。这篇综述把这种落差称为“具身鸿沟”:通用模型可以理解目标,却仍要把目标翻译成特定机器能够感知、安全执行并在失败后恢复的动作。它值得现在看,因为“数据更多、模型更大”并不会自动完成这层翻译。
作者用一张二维图梳理现有方法:一条轴看共享的信息离实际执行有多远,从任务含义、感知和物体交互,一直排到动作技能与身体结构;另一条轴看适配工作发生在哪个阶段。越靠近具体动作,共享能力越容易执行,却也越依赖目标机器的关节、夹爪和控制系统。即便两台机器人都接收末端位移指令,同一个数值也未必产生相同的物理行为。
论文因此主张,评估跨具身迁移时不能只报最终成功率,还应交代换上新机器人后做了哪些接口调整、安全处理和故障恢复。它不是提出一个消除鸿沟的新模型,而是在提醒:规模化成绩可能把部署所需的人力与工程经验藏起来。