一段视频里,球撞墙后弹回来,看着很真;但换个角度、再跑一次,它还会不会遵守同样的规则?这正是“生成”和“模拟”的差别:前者只要画面合理,后者还要让相同状态与操作产生稳定、可重复的结果。
这篇综述以传统模拟器的八项能力为尺子,梳理了2018年至2026年6月的200项代表性工作。最值得注意的不是画质,而是“状态反馈”——模拟器向控制系统返回位置、速度、碰撞等可查询数据。作者逐篇检查163篇实现类论文,发现只有6篇提供了运行时接口,可查询实体状态或物理参数。
作者据此判断,世界模型已能在特定场景中支持交互和控制,却仍无法正式保证物理规律,也缺少丰富的结构化反馈和长期演化的可复现性。说白了,今天的视频模型更像会即兴表演世界的演员,还不是可以替代物理引擎的可靠实验场。