把插头送进插孔时,远处的相机能看清目标在哪,却未必看得清夹爪旁那一点微小的对齐偏差。World-to-Wrist抓住的正是这处短板:VLA——把视觉、语言指令直接转换成机器人动作的模型——不该把主相机和腕部相机当成两路同等用途的画面。前者负责全局任务,后者更贴近夹爪与接触点。
它没有费力生成未来视频,而是预测未来腕部画面的潜在表示——压缩后的内部数字特征。模型结合当前多视角画面、指令与腕部历史,先判断任务进度、物理变化线索和腕部证据,再推测接触区域接下来会怎样变化,并据此生成动作。训练时使用的结构化推理标注,运行时无需逐句生成;作者称动作生成速度超过 80 Hz。
论文在 LIBERO、RoboTwin 2.0 和三项真实机器人任务上报告了提升,但现有原文片段未完整给出成功率数字。更值得记住的是它对多视角的重新分工:腕部相机不是第二个主视角,而是一条专门观察接触过程的近景通道。