Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.083 — 2026-09-25
PAPER 约 7 分钟

GPT-6 Astra意外会操控机器人

GPT-6 Astra未经机器人微调便直接控制机械臂,榜单领先却仅成功22.48%,惊喜与风险同样明显。

你让一个擅长看图、聊天的 AI 去收拾桌面。通常,它可以告诉机器人“先拿起红色积木,再放到盒子里”,真正控制机械臂的却是另一套专门训练过的系统。现在,一篇论文把这层分工拿掉了:研究者让 GPT-6 Astra 看摄像头画面,直接决定机械臂下一步怎么动,而且没有为这些任务专门微调模型。

结果颇为意外。Astra 在 RoboDojo 的完整模拟测试中超过了论文纳入比较的全部 40 个公开机器人策略。但“超过”不等于“已经可靠”:它的平均成功率只有 22.48%。这项工作更像一次边界测试——通用模型似乎已经能碰到机器人的方向盘,却远没有成为可以放心交车的司机。

本文全部效果数据均来自这篇论文,尚无模型开发方、RoboDojo 官方榜单核验或第三方复现实验提供独立确认。

不只出主意,也亲自打方向盘

机器人系统常被分成两层。System 2 负责慢速思考:理解场景、拆解任务、决定“接下来该做什么”。System 1 负责快速执行:把摄像头画面和指令连续变成动作。后者也叫机器人策略(Robot Policy),相当于机器人的驾驶员。

过去常见的做法,是让语言模型担任指挥员,再由预训练机器人策略或写好的技能完成抓取、放置等动作。这篇论文测试的是“LLM as policy”:不让任何学习过的机器人策略夹在中间,由大语言模型直接选择机械臂的运动目标。模型权重保持不变,也不做任务专用微调——即不再拿某类机器人数据继续训练它。

每一轮,Astra 会看到三个 RGB 摄像头视角、机械臂状态和剩余步数,也会保留此前的文字记录;图像只保留最近两轮。它必须选择移动机械臂,或者认定无法完成并放弃。研究者没有提供“一键抓取”“一键放置”之类会替模型完成部分任务的高级技能。软件只负责检查目标是否合法、把目标换算成关节动作,并以 25 Hz 执行。下一轮,模型还能看到实际位置与请求位置的偏差,再决定如何调整。

这仍不等于把模型毫无遮拦地接到电机上,但关键动作目标确实由模型逐步给出。它也拿不到深度、物体精确坐标、奖励状态或现成解法,只能从普通图像估计位置。

第一名,和五分之一成功率

研究覆盖 RoboDojo 全部 42 项任务,并按五类能力汇总。GPT-6 Astra 按每项任务 50 回合的官方协议完成了 2,100 次试验,取得 28.97 Score 和 22.48%平均成功率。Score 是过程奖励均值乘以 100;成功率则只计算真正满足完整成功条件的回合。

按论文采用的评测口径,Astra 排在所比较的 40 个公开策略之前。原先最高的公开策略 DM0.5 成功率为 19.34%,Astra 高出 3.14 个百分点。不过,这不是对整个机器人领域的全面领先,也不是完全同条件的比赛:公开策略没有重新获得研究者提供给 LLM 的任务说明文本。

更值得注意的是能力分布。Astra 擅长需要理解语言和场景、但不要求精密操作的任务。例如,它在“排列最大数字”和“按语言堆积木”上分别达到 60%和 40%成功率,而对照中的最佳公开策略分别只有 4.7%和 2.7%。这说明通用模型原本用于理解语义的能力,可能直接转化成一部分操作优势。

但到了精密、动态或复杂双臂协作,情况反过来。Astra 在插管任务上成功率为零,最佳公开策略达到 59.3%;搭塔任务中,Astra 只有 2%,对照达到 78.7%。论文记录的失败很具体:它会错过传送带上的移动目标,会在双手交接时失败,也会伸手拿下一块积木时撞倒已经搭好的结构。模型似乎知道要做什么,却缺少对接触、碰撞和时机的稳定把握。

其他 LLM 也没有自然获得同样能力。使用相同动作接口和后处理时,GPT-5.5 的平均成功率为 0.88%,DeepSeek-Flash 为 1.92%。不过后者每项任务只测了 10 回合,前两者为 50 回合,因此这组横向比较的统计稳定性不同,不能把差距读得过实。至少在这项研究里,Astra 的表现是模型特有现象,不足以推导出“LLM 普遍会控制机器人”。

给它示范一次,反而更差

研究者还测试了上下文学习:不改模型权重,只在输入中放入一个示范,让它照着做。直觉上,这就像先给新手演示一次操作。

结果并未改善。对 34 项任务的 340 组匹配测试,零样本——即不给示范——成功率为 22.9%;加入图像和机械臂末端位置的示范后降至 17.9%,换成文字示范则降至 12.9%。论文提出两种可能:真正的瓶颈是执行精度,示范无法补上;或者模型错误照搬了示范场景的空间位置。但实验没有把这些原因分开。

另一项小规模测试更耐人寻味。研究者翻转或镜像画面、移除部分相机视角、给动作加入位置抖动,甚至反转坐标轴。Astra 在每种扰动下都至少成功过一部分回合。经过挑选的轨迹显示,它有时会根据动作结果改换机械臂、重新搜索物体,或者连续修正落点。这与“在单个回合内适应反馈”相符,但样本很小,也不能证明它普遍具备在线纠错能力。

为什么这条边界值得重画

具身 AI(Embodied AI)的目标,是让 AI 通过摄像头、关节和机械臂在环境中感知并行动。它比回答问题苛刻得多:一句不准确的话尚可重说一次,一次错误动作却可能撞坏物体。

Astra 的意义正在这种反差里。它表明,通用模型的语义理解、视觉判断和逐步修正能力,可能已经足以承担一部分过去专属于机器人策略的工作。System 2 与 System 1 之间那条“思考归语言模型、动作归专用控制器”的界线,因此不再那么绝对。

但论文自己的现实测试也划出了硬边界。研究团队没有完成 RoboDojo-Real 官方流程,因为 Astra 多次发出不合理或不安全的动作,并造成设备损坏;没有人员受伤。研究者因此停止测试,留下的真实机器人片段只能算诊断材料,不能作为正式成绩。换句话说,这项研究提供的是“通用操作模型可能存在”的初步证据,不是可部署产品的证明。

局限与未知

  • 所有关键结果均出自同一篇论文,GPT-6 Astra 与 GPT-5.5 的版本规格、发布身份及可获得性也缺少独立信源确认。
  • 22.48%的平均成功率意味着多数回合仍然失败;公开策略与 LLM 获得的输入信息也不完全相同,榜首不能直接解释成全面能力领先。
  • 真实机器人测试因危险动作和设备损坏而中止。精密控制、动态控制与双臂协作仍是明显短板,模拟成绩不能推出真实环境中的可靠性或安全性。

供稿材料 SOURCES — 1

← 返回 2026-09-25 · 学术板块