你让机器人把杯子往左推,它在动手前先“想象”了一遍:画面很流畅,杯子却往右走。或者夹爪明明没有夹住杯子,预测里的杯子仍悬空升起。这样的未来看着合理,却不能用来判断动作是否可行。DreamTrue要解决的正是这种错配:让机器人世界模型——用于预演“采取某个动作后,环境会怎样变化”的模型——不只会生成逼真的视频,还必须忠实反映给定动作及其接触后果。
这项工作的关键,是同时修正两个容易被混在一起的问题:动作在画面里有没有对准,以及模型是否真正理解失败。论文称,DreamTrue支持多视角和多种机器人形态,并用几何校准与反事实后训练分别处理这两类问题。下述方法与结果均来自论文作者材料;虽然全文给出了实验设置,其挑战赛名次仍未见赛事官方榜单的独立核验。
先把动作画准
不同机器人表达动作的方式并不统一。DreamTrue没有强求它们共享同一种控制指令,而是把动作轨迹渲染成图像条件:直接画出机器人未来每一步在各个相机画面中的位置、深度、轮廓,并补充夹爪状态和相机运动。这样,不同机械臂的动作都被翻译成同一种“画面语言”。
但这条路有个前提:相机和机器人坐标必须对得准。几何校准可以理解为把地图坐标与现实位置重新对齐。若渲染出的机械臂比录像里的真机械臂偏了几厘米,模型接受的动作提示便和训练目标互相矛盾。
DreamTrue为此做离线几何校准。它利用已有录像、机器人结构模型和记录下来的机器人状态,在渲染画面与真实画面之间寻找对应位置,同时参考跨时间、跨相机视角的对应关系,反过来修正相机参数及机械臂安装偏差。这不需要专门重拍校准序列,也不依赖额外深度数据。
校准确实影响了结果。在 AgiBot 上,从训练到推理都采用修正后的参数,动作跟随指标 nDTW——衡量预测轨迹与目标轨迹接近程度,越高越好——由 0.8159 升至 0.8711;在 DROID 上则由 0.7718 升至 0.8919。只在推理时换用新校准也有改善,说明更准确的空间对齐本身就在发挥作用。
再让模型见识“没做成”
校准解决了“动作画歪”,却解决不了另一个偏差:公开机器人数据多是成功示范,失败案例较少。模型看惯了“夹取—抬起—成功”,就可能把成功当成默认结局。即使夹爪落空,它也会让物体跟着升起来。
DreamTrue的反事实后训练,做法像改写同一场景的行动剧本。研究团队扰动录像中的动作终点,再从初始姿态插值得到一条新轨迹,由逆运动学——根据末端要去哪里,反推出各关节如何运动——转换成可用动作。初始画面不变,动作却可能偏离目标、错过抓取,或形成新的接触方式。
困难在于,这些“如果当时这样动”的动作并未真的执行,因此没有对应的真实未来视频可供逐帧比较。团队转而训练一个具身视频奖励模型,也就是给机器人视频挑错的评分器。他们发布的数据说明,这套人工标注覆盖4.49万段视频,其中包含3.04万条缺陷标注,分别检查机器人形态、物体一致性和交互合理性。例如,夹爪没有碰到物体,物体却自行升起,即使没有标准答案,也能判断为明显缺陷。
评分器再通过强化学习指导视频模型后训练。强化学习在这里不是让真实机器人反复试错,而是让生成器一次产生多种未来,奖励缺陷较少的结果。对于原始记录动作,训练还保留与真实视频比较的 PSNR 奖励,以免模型只顾“少犯物理错误”,却丢掉画面保真度。
数字说明了什么
DreamTrue使用四个机器人数据集联合训练,过滤后共包含2232小时、多视角、五种机械臂的数据。AgiBot上的反事实测试集包含54项任务、160个条件,由三名独立标注者按多数意见判断缺陷。
最直接的变化来自同一模型前后对比。加入反事实奖励训练后,物体缺陷率从31.88%降至3.12%,交互缺陷率从48.12%降至6.25%;反事实动作下的 nDTW 同时由0.8735升至0.8831。也就是说,模型不仅更少生成悬空、消失或复制等错误,动作跟随也没有因此退步。
与论文评测中的 DreamDojo、GE-Sim 2.0、Genie Envisioner 和 EnerVerse-AC 相比,完整模型在记录动作和反事实动作上的 nDTW 都最高,分别为0.8772和0.8831。这里的“state-of-the-art”应理解为论文所列方法与设置中的最好成绩,而不是对所有机器人世界模型的普遍结论。
更实际的一项测试,是拿世界模型估计四种机器人策略在三项双臂任务中的成功率。DreamTrue将预测成功率相对真实模拟结果的平均绝对误差从12.92个百分点降至7.08个百分点。这个指标触及了工作的真正价值:如果模型总替失败动作补出一个成功结局,它就无法充当可靠的行动预演器。
为什么值得关注
我们此前报道 Astra 时,问题发生在动作执行阶段:机械臂会在碰撞、接触和时机上出错。DreamTrue把视线前移了一步,追问机器人在执行之前看到的“未来”是否可信。
它的思路并不是单纯把视频做得更漂亮,而是拆开两个误差来源:先用几何关系保证动作条件落在正确位置,再用反事实动作补足失败与异常接触,用人工学出的奖励纠正过度乐观的生成倾向。对机器人来说,一场可信的失败预演,往往比一场漂亮的成功幻觉更有用。
局限与未知
- 动作条件、视频生成器和奖励模型都在图像空间工作。论文承认,遇到遮挡或视角不足时,系统仍可能把视觉上合理、物理上错误的互动当成正确结果。
- 反事实动作没有成对的真实未来。奖励模型在4893段留出视频上的平均准确率为86.33%、宏平均 F1 为74.21%,说明它并非完美裁判;奖励高不能直接等同于真实世界一定正确。
- 论文报告其在 AgiBot World Challenge 2026 世界模型赛道总分0.829、排名第一,但这一赛事结论目前仍来自作者材料,宜等待官方榜单独立确认。