机器人一边做饭一边“想象未来”,有点像人切菜时偶尔抬头确认下一步:不必每落一刀都停下来重新规划。现有世界动作模型(WAM——预测动作将如何改变环境、再据此决策的模型)若在每次控制前生成未来视频,机器人就得等待;若完全不生成,又会失去明确的视觉目标。GlanceWAM试图拆开这对矛盾。
它让想象模块按较慢节奏在后台运行,只预测数秒后的一帧;控制器则继续高频输出一小段动作,不把视频生成放进每次动作前必须完成的“关键路径”。更巧的是,模型直接使用潜在空间——画面的压缩数字表示——传递未来信息,不必把它还原成可观看的视频。训练时,系统还刻意适应预测结果因异步运行而逐渐“变旧”的情况。作者称,这种稀疏的测试时想象在 RoboCasa 厨房与 LIBERO 任务上兼顾了成功率和实时速度;但供稿文本中的具体数值缺失,因此此处不作量化比较。