机器人做多步任务,常像只顾眼前:物体一旦被手臂挡住,或两个阶段看起来相似,它就可能忘记刚才发生了什么。BridgeVLA++给3D机器人操作补上显式记忆——保留此前的关键信息,同时延续原框架的数据效率和陌生场景适应力,值得关注它能否减少反复采集训练数据的需求。
它建立在Vision-Language-Action(VLA)模型上,也就是把摄像头画面、语言指令和机器人动作接起来。原版BridgeVLA把3D点云投影成多个二维视图,再用热力图标出机械臂应到达的位置。新版本加入两类记忆:时间记忆保存选定的历史观察,帮助判断“下一步做什么”;空间记忆保存较少遮挡时的场景几何,并重新渲染被遮住的目标区域,回答“具体在哪里动手”。
据作者报告,在两类真实机器人上的记忆依赖任务中,BridgeVLA++将平均成功率从原版的20.0%提高到93.3%;它还在两个记忆基准上取得作者所称的当前最佳成绩。不过,论文材料尚不足以判断这种提升能否稳定迁移到更多开放环境。