Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
PAPER 约 8 分钟

DECOWAM:四足底盘与机械臂共想未来

DECOWAM让四足底盘与机械臂一起预演未来,重点不只是走稳或抓准,而是让全身动作真正配合。

你让一台四足机器人走到桌边拿起盒子。它刚迈一步,胸前相机的画面就跟着晃;机械臂一伸,物体和夹爪又同时移动。机器人若分不清哪些变化来自自己走路,哪些来自手臂操作,就像人在移动的车上伸手端水,却只盯着杯子,不管车身正在转弯。

DECOWAM 要解决的正是这个问题:不再把“走路”和“动手”当作两件彼此独立的事,而是用一个统一的世界—动作模型,同时预测未来画面与全身动作。世界—动作模型,可以理解为机器人的内部预演器:它根据当前所见、身体状态和语言指令,推测接下来会看到什么,以及底盘和机械臂应该怎样行动。

以下数字均来自作者在论文中报告的实验,尚无机构外独立信源交叉验证。

画面在动,不等于世界在动

固定在桌边的机械臂比较省心。相机通常不动,画面中的位移大多来自机械臂或物体。四足机器人不同:相机装在会移动的底盘上。机器人前进、转向或受扰动时,整个视野都会变化。

这种由相机自身移动造成的画面变化叫自运动(ego-motion)。如果模型把它和物体运动混在一起,就可能错误理解现场:桌子在画面中向左滑,不一定是桌子动了,也可能只是机器人向右转了。

全身控制还有另一层麻烦。论文设定中,机械臂关节以 15—30 Hz 的频率控制,底盘速度命令通常只有 3—5 Hz。前者需要快速、细小的修正,后者关心较慢的移动方向。若把两类信号直接塞进同一串动作里,模型就得用一套内部表示同时理解“去哪里”和“手怎么动”。

把三件事拆开,再放回同一场预演

DECOWAM 建立在 FastWAM 之上。FastWAM 原本就会联合预测未来视频和一段动作;DECOWAM 的关键变化,是给底盘、机械臂和相机自运动安排各自明确的入口。

首先,它把动作信息压缩为两组潜在表示——也就是模型内部看不见的数字摘要。一组主要保留底盘运动信息,另一组主要保留机械臂信息。训练时,作者用对抗式约束,尽量避免底盘摘要偷偷携带手臂信息,也避免手臂摘要混入底盘信息。可以把它理解为让导航员和操作员各记自己的笔记,最后再共同决定下一步,而不是两个人在同一张纸上混写。

其次,模型把当前底盘速度直接交给视频预测部分。这个速度既是机器人要预测和执行的动作,也是解释未来画面为何整体移动的线索。DECOWAM 不会据此直接搬动画面,而是让视频模型明确知道:接下来的像素变化中,有一部分可能来自相机随底盘移动。

第三,作者加入“action-equivalent future bottleneck”。它在训练时读取未来观察,将其中与动作结果有关的信息压缩成一个瓶颈表示,再把这种结构蒸馏给只能看到当前输入的学生模型。蒸馏可以理解为老师在训练阶段看过答案,然后教学生抓住解题线索;真正部署时,未来画面、教师模块和辅助预测头都会移除,模型仍只依赖当下信息。

大模型不重练,只加机器人专用通道

训练分成两步。第一阶段,作者用 ARMDOG 数据对 FastWAM 全量适配 5 万步,让原模型先熟悉移动相机和四足底盘加机械臂的动作空间。第二阶段冻结 FastWAM,只训练残差适配器以及上述未来瓶颈、底盘—手臂分解和速度条件通道。

这一步只有 25.95M 个可训练参数,相比 FastWAM 全量微调时的 6020.75M,约少 232 倍。但这不代表整个模型缩小了:DECOWAM 总参数量为 6751.38M,略高于 FastWAM 的 6725.44M;减少的是第二阶段需要更新的参数。论文还报告,评估延迟从 1196.6 毫秒升至 1333.2 毫秒,增加 11.4%。所谓“参数高效”,主要指训练更新更集中,不等于模型更轻或推理更快。

ARMDOG 把眼睛、身体和指令对齐

这些接口需要同步数据才能训练。作者构建的 ARMDOG 面向一台带 6 自由度机械臂和 1 自由度夹爪的四足平台,将视频、身体状态与动作、语言指令对齐。

质量筛选后的完整数据包含 1487 个 episode、5 个任务文件夹和 343,550 帧,按 15 Hz 计算约 321.3 分钟。任务以 Bottle Pick&Place 和 Place Block 为主,分别占 56% 和 39%;Object Pick&Place 占 4%,Climb Slope 占 1%。论文同时说明,不同训练与评估阶段使用的是更小子集,不能把完整语料规模直接当成每项实验的训练量。作者称计划提供原始及清洗后的文件、转换数据、固定划分清单和 datasheet,但论文措辞是“planned release”,因此不能据此认定数据已经公开。

预测更准,真正的优势在协调

在固定回放实验中,DECOWAM 与其出发点——训练 5 万步的 FastWAM——使用相同输入和评估流程。它把未来画面的帧均方误差从 1.032×103 降到 8.77×104,下降 15.03%;动作均方误差从 6.87×105 降到 5.38×105,下降 21.71%。这表示预测误差变小,不能解释为任务成功率提高了 21.7%。

单独移除结构模块时,结果也朝同一方向变化。相较只保留残差适配器的对照组,完整模型的画面均方误差降低 4.6%,动作均方误差降低 15.7%,动作平均绝对误差降低 16.1%。去掉未来瓶颈或底盘速度条件,视频和动作指标都会变差。这说明提升并非只来自额外适配参数。

不过,专门做动作预测的 X-VLA 仍取得更低动作误差。DECOWAM 的取舍是:动作精度保持在较强水平,同时额外预测 8 帧未来 RGB 画面和一个 48 步全身动作序列。它想要的不是单项动作榜首,而是让视觉预演与控制共享对未来的理解。

实体机器人实验更能体现这种取舍。每种方法进行了 79 次闭环试验——机器人根据新观察持续调整,而不是一次性执行预先录好的动作。DECOWAM 完成 46 次任务,成功率 58.2%;FastWAM 为 57.0%。两者完成率接近,不能说 DECOWAM 明显胜出。

差别主要出现在过程质量上。DECOWAM 的全身协调成功率为 44.3%,FastWAM 为 34.2%;底盘位移扰动下的稳健成功率分别为 30.4% 和 12.7%。它还以 32.9% 的恢复率领先参评系统,并把平均完成时间从 FastWAM 的 65 秒降至 49 秒。论文所说的优势,因此更准确地落在“底盘移动时,手臂仍能维持操作连续性”,而不是最终任务完成率的大幅跃升。

为什么值得关注

DECOWAM 最有意思的地方,不是又给机器人增加一种预测头,而是改变了移动操作的建模视角。底盘速度不再只是控制输出,也是解释相机画面的条件;底盘和手臂不再分别由互不相干的系统处理,而是在同一次未来预演中分工协作。

这与人的直觉很接近。伸手拿移动中的物体时,我们不会先彻底解决身体移动,再单独计算手臂动作。身体、视线和手会共同调整。DECOWAM 提供的证据表明,把这种“全身共同改变未来”的结构写进模型,可能比单纯扩大统一动作表示更适合腿式移动操作。

局限与未知

  • 全部核心结论来自同一篇论文。实体实验每种方法虽有 79 次试验,但文中未报告方差或显著性检验,领先幅度是否稳定仍待更多验证。
  • 数据任务分布高度集中在两类物体操作上,坡道任务只占 1%。这些结果能否推广到更丰富的移动与操作场景,论文没有给出答案。
  • DECOWAM 降低了第二阶段的可训练参数量,却没有缩小总模型,推理延迟反而增加。它节省多少训练资源、是否适合算力受限的平台,还需要更完整的成本数据。

供稿材料 SOURCES — 1

← 返回 2026-08-24 · 学术板块