机器人投掷物体时,不能挥到一半停下来等大模型想好下一步;可让机器人边动、模型边算,又会产生新的麻烦:模型一次生成的一小段连续动作(action chunk),可能只有部分真正执行,其余会被新计划替换。如果强化学习把整段计划都拿来复盘,没发生的动作也会因成功“记功”、因失败“背锅”。
星尘智能(Astribot)的 SmoothRL 是一套异步在线强化学习框架——机器人持续工作,系统同时根据实际结果继续训练。它把每段动作分成已确定执行、当轮实际执行和将被丢弃三部分,只用实际执行的部分更新策略,并让训练也采用与部署相同的异步节奏。
据团队披露,在 S1 真机投掷实验中,模型每次预测 32 帧动作,真正属于当轮执行的只有 6 帧,另有 20 帧会在执行前被覆盖。SmoothRL 因而瞄准的不是单纯提高模型能力,而是减少机器人等待推理的空转,同时避免训练“对错账”。作者报告投掷成功率在累计 250 个 rollout episodes 的评估节点由 39% 升至 94%;但目前推理仍须满足预设延迟预算,基础策略太弱时,局部修正也无法凭空补救。