机器人端起杯子前,最好先判断杯子会往哪儿移动。但如果它必须先“画”出一段未来视频再动手,反应就会变慢。世界动作模型(World Action Model,WAM)正面临这种取舍:预测越完整,实时控制的计算负担越重。Fast-WAM在执行时直接取消未来画面生成,却也可能丢掉对任务进程的明确预判。
LAWA的办法,是不生成画面,但保留“未来意图”。它用潜在动作——模型内部压缩出的数字表示——记录接下来应发生的关键变化,例如机械臂正在把局面推向哪里,而不重建背景、纹理等视觉细节。训练时,一个离散 tokenizer(把连续变化压成有限代码的编码器)还借助手部、机械臂及交互区域的掩码,让这些代码更关注操作本身。
据论文作者报告,LAWA在 RoboCasa 仅使用 10% 训练轨迹时,平均成功率为 65.6%,比同条件 Fast-WAM 高 9.6 个百分点;同时维持 matched Joint-WAM 的性能水平,并将推理延迟降低 42.9%。这提示世界模型未必需要真的“看见”未来,只要保留足够有用的行动简写,也可能兼顾泛化与速度;代码和模型尚待发布。