让机械臂抓取物体前,先把动作“演”成一段视频,就能提前看看它会不会伸错手、抓偏或中途弄丢东西。DreamX-Phi 1.0 正是这样的动作条件视频世界模型——它不仅猜下一幕,还接收当前画面、语言指令,以及夹爪准备怎样移动和开合的完整动作序列,再预测执行后的视觉未来。
难点在于,视频看着逼真,不代表动作真的对。DreamX-Phi 最值得注意的一步,是把每只机械臂的 SE(3) 变换——三维空间里的旋转与平移——直接注入模型的注意力计算,让模型保留左右臂身份,并沿指定路线生成运动。它还加入深度信息来约束场景结构,并借助 SAM3 物体遮罩和冻结的 V-JEPA 教师模型,尽量让被抓取的小物体在前后画面中保持一致。
作者报告,模型在固定的 WorldArena 2.0 榜单快照中获 Track 1 第一、Track 2 并列第二,并在 WorldArena 1.0 Track 1 的离线评测中取得 76.88 分。模型权重和推理代码要等 WorldArena 2.0 IROS Challenge 结束后公开,因此目前这些结果仍主要来自论文自述。