Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER H 5 · HF 12 约 7 分钟

Agent直接接管真实机器人

通用Agent不经专项训练,边看、边写程序、边纠错,直接驱动真实机器人完成多类操作。

你给机器人看一段装配视频,然后把零件摆到桌上。传统做法通常要先为它准备动作程序,或者训练一套专门的机器人模型。这篇论文换了一个更直接的思路:让平时会看图、推理和写代码的通用 Agent 接管现场。它自己判断该看哪里、机械臂下一步怎么动;动作不对,就重新观察并修改方案。

这套方法叫 Agent as Policy(AGP)。Policy,也就是“机器人策略”,可以理解为机器人的行动规则:看到当前画面和任务后,决定下一步做什么。论文的核心主张是,通用 Agent 无需针对具体任务或环境进行专项训练,也能在执行期间直接充当这套规则。

这值得关注,因为它碰到了一条主流路线的根基。VLA(Vision-Language-Action,视觉—语言—动作模型)把图像、语言指令和机器人动作放进同一个模型里学习,目标是让机器从“看懂要求”直接走到“动手”,但通常需要机器人数据和专项训练。AGP则提出另一种可能:先不训练新的动作模型,改用通用 Agent 在现场推理、编程和纠错。

本文的事实与结果均来自论文作者 Jia 等人的单项研究,尚无独立信源交叉验证。下文所说的“成功”和“无需专项训练”,都应理解为作者在其设备、任务和实验设置下报告的结果。

它不是遥控员,而是现场负责人

过去把 Agent 接到机器人上,大致有两种办法。一种是让 Agent 事先写好程序,机器人执行时照着走。问题是,真实世界很难预先写尽:零件可能偏了几毫米,插入可能失败,摄像头看到的角度也可能不够好。

另一种办法是让 Agent 当调度员,从已经训练好的抓取、放置等技能中挑选下一项。它能决定“调用谁”,却仍受限于现成技能会什么。

AGP把边界再向前推了一步。通用编码 Agent不只负责规划,还直接决定观察、测量和动作。它可以查看顶置相机和腕部相机的图像,读取深度与机械臂状态,在工作区里写 Python 程序,计算物体位置和夹爪姿态,再通过机器人接口发送关节运动、末端位置和夹爪开合指令。

真正关键的是反馈回路。比如一次插入没有成功,Agent可以要求更近的视角,重新估计对齐位置,或者换一个接近方向。这个过程叫闭环控制:机器人每做一步,都重新查看实际结果,再决定下一步,而不是预先生成整套动作后盲目执行。

机器人与 Agent 之间还有一层“桥”。它把相机测量换算到统一的机器人坐标系,检查动作请求,并返回实际位置、目标误差和执行报告。机械臂执行已提交的动作时,底层控制器独立运行;Agent则在一次次工具调用之间继续推理。换句话说,Agent负责“想、算、改”,底层系统负责把合法的目标稳定地执行出来。

论文所说的“无需训练”也要准确理解:执行期间模型参数保持不变,没有针对当前任务或环境再训练模型,但系统并非毫无准备。首次引入一种任务时,另一个编码 Agent 会整理可复用的任务定义,包括目标、约束、完成标准、接口权限和预算;真正执行任务的是随后启动的执行 Agent。相机标定、坐标换算、逆运动学和安全限制也都由机器人接口提供。

它真的能把活干完吗?

作者在真实机械臂上设计了五类任务:根据人类视频装配零件;照目标图片搭积木;把六枚随机摆放的骰子翻到指定朝上点数;定点投掷;以及双臂折叠毛巾。它们分别考查较长的操作链、不同动作方式和可变形物体处理。

主实验中,每次试验都从新的会话开始,模型权重固定,没有先前执行经验,也没有进行模拟排练。每项试验允许系统在时间、观察次数和动作次数预算内自行恢复;一旦需要人工干预或重置,该次自主试验便结束。

作者报告,四对零件装配成功 8/10。三种积木配置中,金字塔为 10/10、两座塔为 10/10、六层单塔为 9/10,合计 29/30。骰子翻转为 10/10。定点投掷土豆完成 2/2。毛巾按顺序折叠为 5/5,但要求两端同时向内运动时只有 3/5,是八种配置中最低的一项。

这些数字说明,在这组有限实验里,通用 Agent确实不只会给建议,而能持续参与真实机器人的动作生成和失败恢复。但它们不能被概括成“机器人任务普遍接近满分”。不同配置的试验次数很少,定点投掷尤其只有两次;论文也没有在这些主任务上给出一套专门训练 VLA 的同场基线。因此,这项研究展示的是路线可行性,还不是对主流路线的全面胜负判定。

不训练,也可以积累经验

模型参数不变,不等于每次都从零开始。AGP可以把测量结果、成功步骤、错误修正和脚本保存在文件里,后续的新 Agent读取这些记录,再根据当前画面更新物体位置。

在两对零件装配的五次连续执行中,从第一次到第五次,任务时间下降了29.3%;推理与编程等响应延迟下降47.0%,工具执行时间则增加9.3%。作者观察到,后续试验会复用几何估计、已经验证的抓取和插入参数,以及图像处理脚本。不过这些是相互依赖的连续试验,只能支持“经验复用与提速有关”,不能单独证明因果。

更有意思的是经验还能转交。较强的 GPT-6 Astra先执行任务并保存文件,再交给较弱的 GPT-5.6 Terra。Terra没有经验时成功率是1/5,读取 Astra 的冻结记录后升至4/5;在成功试验中,平均完成时间下降34.3%,token用量下降11.4%,平均推理成本也降低。这里的经验更像一份会持续修订的工艺笔记,而不是重新训练出的模型能力。

为什么值得现在看

AGP真正挑战的,不是“机器人需不需要控制系统”,而是智能究竟应该放在哪里。VLA路线倾向于把动作能力学进模型;AGP则把通用模型的视觉理解、代码生成和推理能力接入机器人接口,让它在运行时临场计算动作。

如果这条路线能扩展,开发者面对新任务时,可能不必每次都先收集机器人数据并训练专用策略。一个更强的 Agent还可以先探索,再把程序和经验交给更便宜的 Agent重复执行。论文的实验已经给出了这种分工的早期证据。

但“直接接管”并不等于一颗通用模型裸连电机。AGP依赖标定相机、几何查询、逆运动学、轨迹控制、安全边界和明确的机器人接口。更准确地说,它把高层判断和局部动作生成交给 Agent,同时保留了成熟的底层控制设施。

局限与未知

  • 速度和成本仍然很重。 论文明确把执行时间和推理成本列为实际部署障碍。顺序折毛巾虽然5/5成功,平均仍需50.8分钟,推理成本为24.14美元;投掷本身平均13.9分钟,但加上轨迹分析和验证后达到22.8分钟。
  • 证据规模有限。 多数配置只有十次或五次试验,投掷只有两次;目前结果全部来自同一研究团队,也缺少与专门训练 VLA 的完整同场对比。
  • 复杂物理交互仍是短板。 双臂同时折毛巾仅3/5,说明需要协调时序、又会不断变形的物体,仍明显考验这套运行时推理方案。

因此,这篇论文还没有证明通用 Agent可以取代专门训练的机器人策略。它更重要的贡献,是把另一条路真实地跑通了:通用 Agent不只在屏幕里调用工具,也可以在模型参数不变的情况下,通过观察、编程、动作和反馈,持续控制一台实体机器人。


供稿材料 SOURCES — 1
01
Agent as Policy for Robotic Manipulation arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-17 · 学术板块