机器人整理桌面时,不能只看眼前一帧:杯子刚被挪过没有、任务做到哪一步,都藏在此前的画面里。但回看越久,出手越慢。Long-WAM把这对矛盾放进同一套系统设计:既延长视觉记忆,也控制等待时间。
关键发现是,“看得到历史”不等于“会利用历史”。团队先做自回归预训练——让模型按时间顺序根据过去预测未来,再把这种能力用于世界—动作模型,也就是同时理解环境变化并生成机器人动作的模型。作者报告,在RoboCasa GR-1测试中,把视觉历史从0延至19.2秒,成功率由63.3%升至78.7%;采用双向预训练的版本则没有净提升。这说明长记忆的价值,很大程度取决于模型是否提前学会从历史推断下一步。
长记忆还得跟得上现实。Long-WAM一边执行动作,一边处理新画面,并针对不同硬件加速。作者称,在RTX 5090上,每段动作连同未来画面预测耗时107.4毫秒。结果仍来自论文作者自述,但它提出了一个值得关注的系统判断:机器人的记忆长度,不能脱离训练方式和控制延迟单独讨论。