镜头一晃,杯子在画面里换了位置,但它其实没动。视频模型若分不清这两件事,就很难真正理解物理世界,更别说替机器人预演动作后果。StrucPhysVideo 的思路,是先把训练视频里的物理过程讲清楚:结构化描述不只写“机器人操作杯子”,还按对象、材质、接触、形变、状态变化和发生时间提供线索,并把相机运动与物体运动分开。
团队还让模型接收机器人末端执行器的动作指令,再预测后续画面。换句话说,模型不只猜视频自然会怎样继续,还要学习“机械臂这样动,世界会怎样变”。论文报告称,其文本—图像到视频模型在 Physics-IQ Verified 上得分 45.5%,比 Cosmos3-Super-Image2Video 高 2.8 个百分点;按 2026 年 9 月 16 日的榜单快照,在所比较的 17 个模型中排名第一。机器人版本可用四步去噪逐段生成动作结果,但这些效果目前仍以作者披露的评测为准。