Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
PAPER HF 75 约 6 分钟

机器人基础模型先学会找准物体

GAM先把目标钉在三维空间里,再学动作,补上机器人“懂指令却抓不准”的缺口。

你让机器人“把海绵放进碗里”,它可能听懂了海绵、碗和“放进去”,却还是伸错位置。因为知道物体是什么,不等于知道它在真实空间中离机械臂多远、占多大地方。Duan 等提出的 Grounded Action Model(GAM)想补上这一步:先把目标物体准确落到三维坐标里,再让机器人学习动作。

这项工作的意义,不是再给机器人加一层语言理解,而是重新选择它的基础能力。机器人基础模型,是先从大量数据中获得通用能力、再迁移到多种任务的模型。当前常见的 VLA(Vision-Language-Action,视觉—语言—动作模型)会把画面、指令和控制信号接起来;但论文认为,这类模型依赖的预训练目标并不直接要求“公制空间定位”——也就是把位置、尺寸和方向落实到可测量的三维空间。GAM则把这种能力放到起点。

本文数字与结论均来自论文原文,尚无外部复现或独立评测交叉印证。

先找准,再决定怎么动

GAM的核心可以概括成两步:先回答“哪些物体重要,它们在哪里”,再回答“机械臂接下来怎么动”。

输入不只可以是语言。人或上层规划器也可以在画面中点一下目标,或者画一个二维方框。系统先把 language、point 和 box prompt(语言、点和框提示)转换成统一的、以物体为中心的表示。比如“拿起海绵放进碗里”,语言模块会抽出“海绵”和“碗”,再交给 WildDet3D 定位。这个预训练的 3D grounding(3D指代定位)模型会输出物体的二维框、三维框和深度信息。

接下来,GAM保留两类线索。第一类是图像特征:只留下目标物体和机械臂附近的画面,其余区域置零。第二类是检测特征:用点云和三维框明确表示物体的位置、大小、形状和方向。点云可以理解为用许多带坐标的小点描出物体的立体轮廓。

这像是整理操作台:不是把整间屋子的视觉信息都塞给机器人,而是只摆出海绵、碗以及机械臂,同时附上一张标有三维尺寸和位置的清单。论文的关键判断是,背景、干扰物和外观变化若与任务无关,就不该原样进入动作模型。

这些信息再与机器人最近的关节状态合并,由一个多流 Transformer——能让图像、几何、机器人状态和待生成动作相互交换信息的网络——预测一段动作,而非每次只预测一步。动作输出包括关节目标位置和夹爪命令。训练时,3D定位骨干保持冻结,只训练动作部分。换句话说,模型把“学会找物体”和“学会操作物体”相对分开。

为什么多种提示很重要

统一接口让GAM既能自主执行,也能充当低层控制器。高层规划器负责拆解任务和选择目标,GAM负责把选择落实为动作。

例如,多步任务进行到一半后,规划器可以重新在画面中点出下一个物体。若目标已经被遮住,它还可以利用此前的观察记录决定该选谁。部署时,CoTracker3会跟踪初始检测框内的点,以维持物体在连续画面中的对应关系。这样,上层不必重新描述整幅场景,只需告诉低层控制器“现在处理这个”。

这也处理了语言天然含糊的问题。桌上若有几个描述相同的物体,“拿那个杯子”未必足够;一次点击或一个框可以直接消除歧义。

随机场景才真正拉开差距

在 RoboTwin 2.0 的50个双臂任务中,GAM每个任务使用50条干净场景示范训练,测试时每项运行100次。其平均成功率为55.3%。Spatial Forcing为52.0%,但后者是50项任务联合训练,训练设置并不完全相同;在相同单任务协议下,论文称最强基线为45.0%。因此,这些数字不能简单视为严格同条件的统一排名。

更值得看的是随机化场景。GAM没有用随机场景训练动作策略,却取得47.6%的成功率;该设置下排名第二的 Abot-M0 为30.4%。一些模型在干净场景中成绩更高,却在背景、外观和干扰物改变后明显下滑。论文给出的解释是:GAM只把与任务有关的物体送入动作策略,许多无关变化因此不会进入观察。

消融实验进一步支持了这个解释。在选取的10个 RoboTwin 任务上,完整模型平均成功率为46.8%;取消图像遮罩后降至22.3%,不再裁剪目标点云后降至12.8%,两者都取消则只有10.3%。只保留三维检测特征为16.0%,只保留图像特征为20.3%。至少在这组实验中,筛掉无关内容,以及同时保留外观与三维几何,都很重要。

它不只是适应新背景

LIBERO-PRO更直接地测试模型是否真的找到了指令所指的对象。训练数据中的物体布局固定,测试则分别改变外观与尺寸、位置、指令措辞,以及任务目标。后两类变化尤其难:旧轨迹不再适用,机器人必须根据新位置或新目标调整动作。

GAM在16种扰动设置中的平均成功率为61%,高于 π0.5 的53%,作者据此称其达到 state of the art。不过分项表现并非全面领先:物体尺寸和外观变化时,GAM在四组任务上都落后于部分基线;论文推测,模型虽然看见了几何变化,却未必学会调整训练中没见过的抓取方式。

真机结果也呈现类似趋势。双臂 YAM 在常规条件下,GAM与 π0.5 都成功19/20次;发生视觉变化后,GAM为17/20,后者为4/20。这个对比直观,但每种条件只有20次试验,样本仍小。

在单臂 Franka 上,Molmo2负责规划和记忆,GAM根据其点选执行。四项长时程或依赖记忆的任务中,系统取得64.7%的分布内(ID,即接近训练条件)步骤完成率,以及49.8%的分布外(OOD,即背景、光照、物体或干扰因素改变)步骤完成率。这里统计的是完成步骤的比例,不是完整任务成功率,不能与前述数字直接横向比较。

局限与未知

  • GAM依赖3D定位质量。目标一旦找错,错误会传到动作端;过度过滤场景也可能漏掉未被选中却会妨碍运动的障碍物。
  • 论文未给出方差、置信区间和随机种子等完整统计信息,不同基线还存在单任务训练与多任务联合训练等协议差异。
  • 当前证据说明“先定位再行动”很有潜力,但尚不足以证明3D grounding已经成为机器人基础模型的通用最优起点。更准确的说法是:GAM把一个长期隐式学习的问题,变成了可直接表示、检查和控制的接口。

供稿材料 SOURCES — 1

← 返回 2026-09-24 · 学术板块