机器人在明亮房间里会抓东西,换到黑暗环境或陌生视角,却可能立刻失手。问题不一定是它不会抓,而是它看不清、找不准。ART(Agentic Robot with Tool-use)尝试给现有 VLA——把画面和语言指令直接变成动作的机器人模型——加一个“工具箱”:模型发现自身能力不够时,可临场调用视觉增强、物体定位或运动规划等外部模块,再继续执行任务。
最值得注意的是它怎样避免“学新忘旧”。研究者冻结原有 VLA,只训练 LoRA——附加在模型上的一小组可调参数——来学习判断何时、如何调用工具;工具返回结果后,生成机器人动作时又屏蔽 LoRA 输出,让原模型接回控制权。这样,工具推理与原有动作能力被拆开,新增能力不必重练整套模型。作者用 3 万条工具调用轨迹和动作示范训练,并自述 ART 在 LIBERO 模拟及真实任务中,成功率比主流基线高 20%,包括陌生视角下的暗处抓放;这一效果仍以论文实验为准。