Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.061 — 2026-09-03
PAPER H 17 · HF 80 约 6 分钟

机器人数据不够,先扩表示

机器人轨迹难堆量,VLAct改从表示下手,让有限数据更能跨任务、跨身体复用。

你教机器人收拾餐桌,最贵的往往不是模型,而是示范:真人操控机械臂,一遍遍展示怎样抓、放、避障。换一张桌子、一个物体,甚至换一种机械臂,又可能要重新采集。机器人轨迹无法像网页图文那样批量抓取,也不可能覆盖物理世界里的所有变化。

VLAct 论文换了一个问题:既然轨迹短期内不够多,能否先让模型更善于从有限轨迹中提炼可复用的知识?它没有否定数据规模,而是把VLA扩展的另一个轴摆到台前——表示质量。

VLA(Vision-Language-Action)是把摄像头画面和语言指令直接变成机器人动作的模型。它既要看懂环境、理解要求,也要知道身体下一步怎样动。本文全部效果数字均来自作者团队及其论文,尚无独立信源交叉验证。

不是多背动作,而是先学会归纳

VLAct从一个已经训练好的VLM(Vision-Language Model,视觉语言模型)出发。这个模型原本从广泛的图文数据中学会识别物体、属性和空间关系。作者随后用DROID、InternA1、RoboCoin和MolmoAct等公开机器人数据进行持续预训练——不是从零训练,也不是立刻钻研某一个任务,而是先补一轮跨机器人、跨任务的“通识课”。真正部署到具体任务时,再做微调,也就是用目标机器人的数据进行“岗位培训”。

这里的核心是表示学习:模型不只记住某段轨迹对应哪些动作,还要在内部整理出更通用的特征。例如,它应当理解“这是可以开合的夹爪”“这个物体适合从这里抓”,而不是只记住某张画面里的像素和某台机器人的控制数值。

作者发现,直接拿机器人轨迹继续训练有三种风险。第一,机器人画面远比原始图文数据单一,全面更新模型可能冲淡已有的视觉和语言能力。第二,只用一种动作头——把模型内部特征翻译成控制指令的输出模块——会让主干模型过度适应该模块。第三,不同机器人各用一套完全隔离的输出空间,会浪费它们之间本可共享的动作含义。

三个约束,把有限轨迹榨得更干净

VLAct先保护原有能力。持续预训练时,它冻结视觉编码器和语言模型较浅的一半层,只让较高层学习动作推理;同时混入图片描述数据,继续提醒模型物体、属性和空间关系是什么。论文消融实验显示,保护浅层分别让LIBERO-Plus和Agilex下游表现提高3.7和3.4个百分点。

第二步是同时接上OFT、PI和GR00T三种连续动作头,让它们读取同一份内部表示、预测同一段真实动作。可以把它理解为:同一套课堂笔记要同时交给三位解题习惯不同的学生使用。笔记若只迎合其中一人,另外两人就读不懂。多头共同监督迫使主干留下更普适、又保留动作幅度和时序细节的信息。预训练结束后,这三个动作头会被丢弃;微调时重新安装适合目标任务的动作头,因此最终复用的是主干表示,而不是一套提前练熟的控制器。

第三步处理不同“身体”。VLAct只统一物理含义确实相近的动作维度。例如,不同机器人的夹爪都存在开合,可以共享监督;机械臂关节数、结构和运动方式不同,就保留各自维度,并遮掉当前机器人用不到的部分。周期性关节角则采用考虑角度回绕的损失,避免把实际相邻的角度误判为相距很远。

数字说明了什么

在LIBERO-Plus上,VLAct达到82.6%的总成功率,比使用相同Qwen3-VL模型家族和OFT下游动作头的内部基线75.0%高7.6个百分点,也比论文列出的ABot-M0高2.1个百分点。这个基准会改变相机视角、机器人状态、噪声、物体布局和任务指令,增益主要出现在相机、机器人、噪声与布局变化上,符合“表示更耐变化”的设计目标。

在RoboTwin 2.0的数据扩展设置中,VLAct-OFT在Clean和Random评测上分别达到92.5%和90.8%。换用PI动作头时,Clean结果还升到93.0%;三种动作头的Clean成绩相差不超过3.4个百分点。这组结果支持作者的判断:改善来自较容易转接的主干,而非只对某个输出头有效。

更关键的测试是换身体。持续预训练没有见过GR-1人形机器人,但VLAct在RoboCasa-GR1上只用20%的下游轨迹便达到49.5%,超过使用全量数据的GR00T-N1.6基线47.6%;使用全部数据时为54.0%。这只能说明该特定设置下的数据效率,不能概括成所有机器人都只需要五分之一数据。

真实机器人实验也给出同方向证据。作者用Franka Research 3机械臂、每项评测10次,对比未经这轮预训练的Qwen3VL-4B-OFT。VLAct在双臂任务上的平均成功率为72.0%,基线为44.0%;而它的持续预训练数据只有单臂轨迹。不过,十次试验仍是较小样本。

为什么值得关注

这项工作的价值不只是又刷新了几个表格。它把VLA竞争中的“扩展”拆成两件事:一是收集更多轨迹,二是让每条轨迹形成更可迁移的内部知识。前者昂贵且覆盖永远稀疏,后者则可以通过训练设计改进。

VLAct还只使用公开数据,并在16张GPU上完成持续预训练。这提高了复现可能性,但论文没有给出GPU型号、训练时长和总计算量,因此不能直接把“16张GPU”等同于低成本。

局限与未知

  • 所有成绩和排名均为作者自述。论文未完整披露部分结果的重复次数、方差,以及外部系统之间的模型规模、预训练数据和算力是否可比。
  • RoboDojo上,VLAct按成功率在35个策略中排第六,并超过全部明确标注为WAM的参赛项;这不等于总榜领先。其Memory类任务仍是明显短板。
  • RoboCasa-GR1的20%对全量比较很醒目,但双方预训练数据、模型规模等条件未完全对齐,现阶段更适合视为“表示可能节省下游数据”的证据,而非普遍规律。

供稿材料 SOURCES — 1

← 返回 2026-09-03 · 学术板块