同样是拿杯子,单臂、双臂和人形机器人看到的目标相似,身体却完全不同:关节数量、夹爪结构和可接收的指令都不一样。跨本体 VLA——根据视觉和语言直接预测机器人动作的模型——若强行统一这些动作,往往需要人工转换。DyPES-VLA 换了一种拆法:共享对“动作会怎样改变世界”的理解,具体怎么动则各学各的。
它先让模型预测未来画面,从人类和机器人视频中学习动力学先验——例如物体运动、接触及场景变化的通用规律。随后,专属的 MoE 动作头——按机器人身体选用不同“专家”模块——把这份共同理解翻译成各自原生动作空间里的指令,不必预先把异构动作对齐成统一格式。模型在单臂、双臂和人形三类本体上联合训练;据作者报告,单一检查点在 LIBERO、RoboCasa-GR1 和 RoboTwin 2.0 的成功率分别为 98.0%、59.25% 和 89.02%,在三种实体机器人、三项任务上的平均成功率为 75.6%。更值得注意的不是“一个大脑控制所有身体”,而是它承认控制仍有身体边界,只把真正可复用的环境规律放在一起学。