让机器人伸手抓东西时,大模型还在计算下一步,它该停住,还是沿着旧动作继续?停住会卡顿,继续又可能因环境已变而出错。视觉—语言—动作模型(VLA,即把画面和文字指令转成机器人动作的模型)越大,这段等待越难忽略。论文提出 Arli,用强化学习(通过结果反馈改进动作的训练方法)让机器人把等待期间的行动也学进去。
它最关键的一步,是不让控制器只看“旧画面”:系统还把已经承诺、即将执行的动作写入状态,并在大模型推理途中补看一次更新的观察。这样,算法眼中的“现在”更完整,不容易破坏强化学习依赖的马尔可夫假设——当前状态应足以预测下一步。作者称,在多项仿真任务和三项双臂 UR5e 真实操作任务中,Arli 能在朴素异步方案与同步等待方案失效的条件下继续改进策略;这些效果目前来自论文自述。