你看见一个人从不同角度拿起杯子,会自然明白:虽然画面变了,动作还是同一个。模型却可能把袖口颜色、相机位置和杯子在屏幕上的移动都当成动作。结果是,它很会复原画面,却未必理解手和杯子在三维空间里发生了什么。
LAWM-3D想解决的正是这个问题。它从没有机器人控制标注的人类视频中提炼“潜在动作”(Latent Action)——不是“机械臂向右转10度”这样的明确指令,而是模型根据前后画面的变化,自己归纳出的动作代码。研究团队希望用这些代码训练机器人世界模型:一种能根据场景和候选动作预测后续状态、让机器人在内部先“预演”再做决定的模型。
这项工作的价值很直接。带有精确动作记录的机器人数据昂贵,而且不同机器人的控制方式并不统一;普通人类视频则丰富得多。若能从后者学到可迁移的动作规律,世界模型的训练材料就不必完全受限于机器人采集。不过,本文的效果证据目前均来自作者论文,尚无外部独立验证。
多几个机位,为什么还不够?
一个直觉方案是把同一动作的多个机位都交给模型。按理说,模型看过正面、侧面和第一视角,就该拼出三维运动。论文的消融实验却得到相反结果:以 DreamDojo 的潜在动作模型为基线,只加入多视角数据后,潜在动作模型的 PSNR 从 29.31 降至 28.97,世界模型的 PSNR也从21.22降至20.53。PSNR是衡量预测图像与目标图像接近程度的指标,通常越高越好。
作者给出三个原因。首先,不同相机的外观和视角差异会制造噪声。其次,多视角画面仍是三维世界的二维投影,本身没有告诉模型不同画面里的位置如何对应。更关键的是训练捷径:编码器同时看到前后帧时,可能把未来画面的颜色和纹理压缩进动作代码,再让解码器照着复原。它完成了练习题,却把“动作”学成了未来画面的缩略包。
把动作与画面拆开
LAWM-3D用三项相互配合的设计堵住这些捷径。
第一项是统一的动作 tokenization。Tokenization可以理解为把连续信息整理成模型可处理的代码。训练时,系统随机遮掉部分机位,但至少保留一个,再要求模型从不完整观察中提炼统一动作。这样,同一次拿杯子不能因为相机换了位置就变成另一套代码。模型还能混合使用多视角和单视角视频,推理时则可退回单一视角。
第二项是几何对齐。团队借助预训练的3D基础模型VGGT,把编码器的中间特征向已有的跨视角几何表示对齐。通俗地说,多机位画面原本只是几张照片;VGGT提供一把“空间标尺”,提示模型哪些区域对应同一物体和结构。消融实验中,只加入这种对齐后,潜在动作模型PSNR升至29.84,世界模型PSNR升至21.36。
第三项是“非注入式”的RGB-D联合重建。RGB是彩色画面,D是深度图,也就是各处距离相机多远。深度信息只在解码阶段提供,不交给编码器直接抄入动作代码;解码器则要同时预测未来彩色画面和深度。作者希望借此降低模型对颜色、纹理等外观线索的依赖,迫使它关注具有几何意义的运动。完整方案在同一消融中取得30.56和21.68的PSNR,均为表内最佳。
人类视频先打底,机器人数据再对齐
完整训练流程实际分三步。团队先用多视角和单视角视频训练潜在动作模型;再把提取出的动作代码当作“伪动作标签”,在人类视频上预训练世界模型;最后用真实机器人交互数据微调,把抽象代码与机器人的实际控制信号对齐。因此,这项工作不是让机器人看完人类视频便直接会做动作,也没有摆脱机器人数据。它尝试减少的是前期学习通用运动规律时,对昂贵控制标注的依赖。
训练材料包括Ego-Exo4D、Assembly101和EgoDex等人类视频。前两者提供同步多视角,EgoDex提供单一第一视角;潜在动作模型的预训练还加入了若干机器人数据集。论文将每段视频处理为13帧,用第一帧作为条件,预测其余未来帧。
它带来了多大改善?
在潜在动作模型的画面与深度预测中,LAWM-3D均超过论文列出的对手。例如在Assembly101上,它的RGB预测PSNR为35.76;DreamDojo为33.43,加入深度解码器的DreamDojo-D为33.12。这个对比至少说明,收益不能简单归结为“多预测了一张深度图”。
在WorldArena世界模型评测的16项指标中,LAWM-3D取得13项表内最高值。较值得注意的是与动作和空间有关的指标:轨迹准确度为0.350,DreamDojo为0.322;动作遵循为0.095,DreamDojo为0.087;交互质量为0.578,DreamDojo为0.558。它并非每项都领先,例如审美质量低于DreamDojo,动作遵循也低于GigaWorld。更稳妥的结论是:按作者实验,三维动作表示主要改善了运动、空间和交互预测,而不是全面碾压所有生成质量指标。
论文还在包含未见场景、物体和交互方式的分布外测试中比较泛化能力。LAWM-3D的2B模型在三个测试集的PSNR分别为21.465、20.542和19.034,均略高于DreamDojo-14B的21.413、20.525和18.924。差距不算巨大,但较小模型仍保持领先,是一个值得继续验证的信号。
为什么值得关注
LAWM-3D最有意思的地方,不是又做出一个更会生成视频的模型,而是重新界定了人类视频能给机器人什么。普通视频无法直接提供机械臂指令,却可能提供跨身体、跨场景的运动结构。三维感知若能把这种结构从外观变化中分离出来,人类视频就可能成为机器人世界模型的通用预训练材料。
它也给出了一个克制但重要的反例:数据视角更多,不代表模型自然理解三维。没有几何约束时,多机位甚至会增加混乱。真正关键的是训练目标是否迫使模型学习空间关系,而非仅仅记住像素。
局限与未知
- 所有主要结论目前都来自论文作者。所谓“SOTA”和“显著改善”尚缺少外部复现,部分指标优势也较小。
- 本文证明的是世界模型预测与生成指标改善,不能据此断言真实机器人已经更可靠地执行人类动作。
- 方法仍需真实机器人数据完成动作空间对齐;它缓解数据瓶颈,但没有消除这一成本。