机器人刚看见目标球藏进左边盒子,盒盖一关,接下来还能选对吗?MIKASA-Robo-VLA就是为这类问题设置的专项考场。它评测VLA(Vision-Language-Action,视觉—语言—动作)模型——也就是把“看懂、听懂、动手”接进同一套系统——能否在长任务中使用已经离开视野的信息,而不是只对眼前画面作反应。
这套基准包含90项语言指令操作任务,覆盖10类记忆。其中80项会隐藏决定后续动作的关键线索,另有10项始终保留线索,作为不需要长期记忆的反应式对照。最值得注意的是,作者没有只按任务总时长判断难度,而是单独测量线索确定不可见的“信息空档”:70项任务标注了这一时间,28项的空档超过其调研中固定上下文最宽模型的16帧窗口。这样一来,失败更容易被定位为记忆问题,而不再笼统混进感知、规划和控制能力。团队还发布了22,500条示范轨迹;不过论文只在14项任务上测试参考基线,尚不能据此判断现有VLA的整体水平。