Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.050 — 2026-08-23
PAPER 约 7 分钟

ADEPT:灵巧手先预训再强化

ADEPT让多指机器人先练通用手上功夫,再稳妥转学插接、摆盘等具体任务。

你让一个从没下过厨的人直接把盘子竖着插进碗架,TA多半连怎么拿盘子都要从头试。多指机器人也一样:每换一个任务,常常要重新学伸手、抓取、抬起和转动物体。ADEPT想做的,是让机器人先练一套通用“手上基本功”,再学习插销、摆盘等具体工作。

这件事现在值得看,因为多指机械手的自由度很高。自由度(DoF)可以理解为能够独立活动的关节或运动方向。关节越多,手越灵活,控制也越难。ADEPT把大规模预训练和后训练接进同一条强化学习管线,并在两套真实机器人上测试了从仿真到现实的迁移。不过,所有结果均来自论文作者自己的实验,尚无独立复现。

先练会拿,再练会用

ADEPT全称是 Accelerating Dexterity via Pre-Training。它的核心思路很朴素:不要让机器人每接到一道新题,都重新学习怎么活动手指。

第一阶段是预训练。研究者让机器人在模拟器里反复完成“物体重定向”:伸手接近物体,抓住它,抬起,在手中调整姿态,搬到目标位置,再按指定姿势放下。训练物体包括16种不同尺寸的圆柱、长方体、球体和圆锥。

这里使用强化学习(RL)——机器人尝试动作,再依据成功、稳定和安全等奖励调整策略,类似通过得分练习技能。训练还采用逐步加难的课程:随着成功率提高,目标和环境会变得更复杂。论文称,这一阶段用了80亿个环境步。

第二阶段才针对具体任务后训练,例如拿起插销、转到正确方向并插入孔中。预训练策略没有见过这些完整任务,却能直接完成其中的搬运和调整姿态阶段。这里的 zero-shot,指没有针对这一步额外训练便能执行,并不等于机器人能解决任意新任务。

直接微调,基本功反而会丢

真正棘手的地方不是预训练,而是怎样继续训练。

研究者发现,把预训练策略直接交给常规强化学习微调,它很快就会忘掉已经掌握的动作。在插销任务的同一起点上,直接微调经过少量更新后,原有阶段的成功率降到零。原因包括任务奖励改变、输入中增加了插座位置和接触力等信息,以及负责判断动作长期价值的 critic 尚未适应新任务。critic可以理解为训练时的“评分员”:评分员还没弄懂新规则,策略就根据错误评分大幅改动作,结果越练越乱。

ADEPT用三步控制这种遗忘。

第一步是行为克隆蒸馏。新策略先观察旧策略怎样行动,用4万次监督训练把基本功复制过来,同时接纳下游任务新增的输入。第二步是 critic warm-up,也就是先冻结动作策略,只让评分员用新奖励学习20轮。第三步才恢复共同训练,但显著降低策略的学习率,限制每次更新的幅度。

消融实验——逐项拿掉组件,看性能如何变化——显示,较低的策略学习率是防止崩溃的必要条件。critic预热改善成功率和稳定性,行为克隆则明显缩短适应时间;更严格的 PPO 更新裁剪作用不大。PPO是一种常见强化学习算法,它会限制新旧策略之间一次改变得有多远。

预训练花了80亿环境步,单个下游任务后训练再用30亿步,总计110亿步。论文的关键账目是:80亿步的基本功成本可以由多个任务共同分摊,以后每增加一个任务,边际训练成本是30亿步。相比之下,从零训练对随机种子很敏感,多数实验停在课程早期,只有少数在约90亿步后继续推进。

给策略加一道“安全传动层”

高自由度机械手还有一个现实问题:让策略直接控制全部关节,容易碰撞或撞到关节极限;若把动作压缩到少数固定抓握模式,又会牺牲灵活性。

ADEPT在策略与机器人之间加入 joint-space Geometric Fabric。它可以理解为一层实时动作协调器:上层策略提出各关节想往哪里动,这一层负责生成平滑动作,同时避开关节极限、自碰撞和环境碰撞。它开放完整关节空间,而不是把手限制在少数预设姿势。模拟器和真实机器人使用同一套底层接口,也减少了迁移时控制方式不一致的问题。

从“知道状态”到自己看懂

训练教师策略时,模拟器可以直接提供物体位置、姿态和接触信息。真实部署却不能依赖这些标准答案。因此,研究者又把教师策略蒸馏成感知学生策略,让它根据相机和机器人自身状态行动。

学生也分两阶段学习。它先跟随重定向教师,从双目RGB图像中辨认插销、估计姿态并跟踪抓取过程;再跟随下游教师学习接触密集的插入动作。论文报告,只做后一阶段的单阶段方案,在两种插销上都未能迁移到现实,说明视觉基本功本身也需要预训练。

在23自由度的 Kuka iiwa7 + Allegro 四指手上,学生使用两台RGB相机。在29自由度的 Flexiv Rizon + Sharpa 五指手上,除两台RGB相机外,每根指尖还有一个视觉触觉传感器。仿真到现实迁移(sim-to-real)指先在虚拟环境大量训练,再把策略直接部署到实体机器;困难在于模拟器无法完全复制现实中的摩擦、触觉和机械误差。

十次测试说明了什么

真实机器人实验每项进行了10次。Kuka-Allegro仅靠视觉完成星形插销5次,完成更难的方圆组合插销3次,完成碗架放盘6次。放盘任务尤其值得注意:盘子比预训练物体更大、更扁,预训练策略无法直接抓住它;后训练最终学会了抓盘,并在盘子倒扣时形成翻转后重新抓取的动作。这说明后训练并非只能修补已有技能,也可能从一个较好的动作起点发现新行为。

触觉的作用更直接。Flexiv-Sharpa仅靠视觉完成方圆插销3次;加入五个指尖触觉传感器后,成功8次。触觉版本10次都成功抓取并抬起物体,9次完成重新定向。论文观察到,视觉版本即使已经抓稳,也可能因为无法确认接触而重新张手,随后掉落;触觉信息减少了这种不确定性。

论文还称系统以“human-level speed”执行任务,但材料中的具体时间区间和速度倍率缺失,也没有足够的人类基线、任务范围和统计信息。因此,更稳妥的结论只是:作者观察到机器人能够把抓取、转向和插入连成连续动作,不能据此泛化为灵巧操作整体达到人类速度。

为什么值得继续观察

ADEPT最有意思的地方,不是某一次插销成功,而是它把“通用基本功—稳定转学—感知部署”串成了一条完整管线。预训练负责把策略送到一个更有希望的动作区域;后训练避免基本功被新奖励迅速冲掉;感知蒸馏再把依赖模拟器真值的教师变成能看图、在部分平台上也能感受接触的学生。

如果这条路线能扩展,机器人学习新任务时就不必重复支付全部训练成本。但目前的证据还不足以证明它已经成为通用方案。

局限与未知

  • 所有论断来自同一篇论文,真实实验只覆盖两种指定机器人形态、两类插销和碗架放盘,不能外推到任意机器人或任务。
  • 视觉仍是主要瓶颈。遮挡会导致非对称插销方向估计错误;快速运动时,小接触面也会让抓取不稳。触觉改善了接触判断,却没有解决遮挡下的物体姿态识别。
  • 预训练只使用16种简单几何体。论文也承认,若新任务需要与既有基本功差异很大的操作,可能必须扩大预训练范围,加入更丰富的手内操作、工具、杂乱环境或双手任务。

供稿材料 SOURCES — 1

← 返回 2026-08-23 · 学术板块