你让机器人把杯子放进柜子。它不仅要决定手臂下一步怎么动,还得预想:夹住杯子后,眼前的画面会怎样变化。传统做法常把这两件事分开训练,像是一个人负责想象后果,另一个人负责下指令。WorldDiT想把它们合成一条链:同一套模型一边学习“做什么”,一边学习“做完会看到什么”。
这项工作值得看,不是因为它又堆出一个更大的机器人模型。恰恰相反,作者想验证:不把大型预训练视觉语言模型(VLM——同时处理图像和文字的模型)当作动作生成的主干,能否仍然做好控制。以下结果均来自WorldDiT作者团队的论文与其汇总的公开成绩,尚无独立复现。
两项任务,交给同一个“大脑”
WorldDiT是一种统一的Diffusion Transformer,简称DiT。扩散模型的基本做法,是先把数据逐步扰乱,再学习如何从噪声中将它还原;生成时,模型从随机噪声出发,反复修正,最后得到合理结果。DiT则让Transformer承担这个逐步修正过程,用它来协调视觉信息、机器人状态和动作序列。
训练时,WorldDiT接收最近几步的多视角画面、机器人自身状态和语言指令。画面包括主相机与腕部相机。视觉和语言信息分别经过冻结的MAE图像编码器与CLIP文本编码器——“冻结”意味着这些模块在训练WorldDiT时不再更新;机器人状态则由可训练的编码器处理。
关键在共享的DiT主干。它同时学习两种目标:第一种是连续七步的动作块;第二种是未来相机画面中的归一化RGB图像块。动作块,就是一次规划未来多个时刻的动作,而不是每一步都从头决定。这样更容易形成连贯操作,但模型也必须让整段动作与未来画面彼此对应。
所谓RGB图像块,是把未来画面切成小块,再让模型预测这些小块经归一化后的像素目标。归一化可以理解为先把每块图像调整到较统一的数值尺度。作者没有要求模型在部署时真的输出一张完整的未来图片;这些图像块主要是训练信号,逼着共享主干理解“动作会怎样改变视觉世界”。
这有点像学开车时,不只背方向盘该转多少,还同时练习判断:这样转下去,车头接下来会出现在什么位置。两种练习共同塑造同一套判断能力。
训练时想象,执行时只管动作
WorldDiT用flow matching训练。它让模型学习一条从高斯噪声通往正确目标的连续变化路径,动作与未来图像块都采用这套生成方式。总训练损失由动作误差和RGB图像块误差加权组成。
但到了实际控制阶段,未来画面预测分支会被移出推理流程。模型只从噪声中生成七步动作,执行前三步,然后读取新的观察,再重新规划。这是一种滚动式控制:计划得比实际执行稍远,但不会一口气把整段动作做到底。环境一旦变化,机器人还有机会修正。
这套安排是WorldDiT最清楚的架构主张:世界预测不一定要成为部署时的额外负担。它可以在训练阶段充当老师,帮助动作主干学到更好的环境变化规律;真正运行时,则保留动作路径。
需要强调的是,“没有大型预训练VLM动作主干”不等于完全不用预训练组件。WorldDiT仍使用冻结的MAE图像编码器和CLIP文本编码器。它缩小的是动作主干对大型VLM的依赖,而不是把所有预训练模型都拿掉。
3.99亿参数,成绩处在什么位置?
作者在LIBERO机器人操作仿真基准的四个套件上评测WorldDiT:Spatial、Object、Goal和Long。四项成功率依次为98.0%、97.0%、92.8%和91.8%,平均为94.9%。其中Long要求更长的多阶段行为,也是WorldDiT成绩最低的一项。
整个系统共有3.99亿参数,这一统计包含推理时需要的冻结模块。按论文汇总的结果,在同时报告四个套件平均成绩的方法中,WorldDiT位于“参数量—平均成功率”的Pareto frontier,也就是帕累托前沿:比它平均成功率更高的方法,参数更多;参数不超过它的其他方法,所报告的平均成功率更低。
例如,同属“不使用大型预训练VLM动作主干”一组的DreamVLA平均成功率为92.6%,低于WorldDiT的94.9%。不过,WorldDiT并非所有方法中的最高分。使用大型预训练VLM动作主干的ACoT VLA报告了98.5%的平均成功率。论文真正支持的结论,是WorldDiT在规模与成绩之间给出了有竞争力的折中,而不是全面领先。
为什么这条路线值得关注?
机器人控制中的世界建模,回答“做完以后会看到什么”;动作建模回答“现在该怎么做”。WorldDiT把两种目标放进同一套生成框架,却没有要求机器人运行时额外生成未来画面。这让“用世界模型帮助行动”变成了一种相对紧凑的训练设计。
它也把一个常被模型规模遮住的问题重新摆到台面上:控制能力究竟来自更大的预训练主干,还是来自动作与世界预测之间更合适的组织方式?WorldDiT没有彻底回答这个问题,但3.99亿参数系统的结果说明,架构本身值得单独研究。作者也将它定位为后续扩展模型容量、数据多样性和部署环境时的基线,而不是已经证明了规模扩展规律。
局限与未知
- 评测只覆盖LIBERO仿真环境。论文材料没有给出真实机器人部署结果,因此不能据此判断现实环境中的可靠性。
- 部分用于阶段性检查点选择的仿真回合也进入了最终汇总,结果并非完全独立的留出测试,作者明确提醒不要把它视为无偏估计。
- 对比成绩来自各方法自己的报告,权重和代码也未全部公开,无法在完全统一的流程下复现。所谓帕累托前沿还只纳入报告了全部四个套件的方法;缺少套件成绩的方法会被排除。