Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 1 约 1 分钟

机器人学会在推理等待时行动

让机器人把“等待模型思考”的空档也纳入学习,减少停顿与失控。

让机器人伸手抓东西时,大模型还在计算下一步,它该停住,还是沿着旧动作继续?停住会卡顿,继续又可能因环境已变而出错。视觉—语言—动作模型(VLA,即把画面和文字指令转成机器人动作的模型)越大,这段等待越难忽略。论文提出 Arli,用强化学习(通过结果反馈改进动作的训练方法)让机器人把等待期间的行动也学进去。

它最关键的一步,是不让控制器只看“旧画面”:系统还把已经承诺、即将执行的动作写入状态,并在大模型推理途中补看一次更新的观察。这样,算法眼中的“现在”更完整,不容易破坏强化学习依赖的马尔可夫假设——当前状态应足以预测下一步。作者称,在多项仿真任务和三项双臂 UR5e 真实操作任务中,Arli 能在朴素异步方案与同步等待方案失效的条件下继续改进策略;这些效果目前来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 学术板块