一辆车如果训练时几乎只直行,AI 即使能准确预测下一帧,也未必真的懂得“向左打方向会怎样”。这篇理论工作追问的正是这件事:世界模型——AI 对环境变化的内部模拟——何时能从观察和动作中,唯一辨认出真实的内部状态与受控动力学,也就是环境如何随动作变化。
作者研究了动作条件版 JEPA——不预测每个像素,而是在压缩后的表征空间里预测未来。结论是,准确预测还不够:内部状态必须具有足够清晰的“谱分离”,每个动作方向也要在相同状态下得到充分尝试。两项条件同时成立时,模型才能恢复状态与完整动力学,允许的差别只是整体旋转坐标轴,不改变实际结构。更值得警惕的是,作者证明:某个动作方向在数据中越少出现,反事实预测——“如果当时换个动作会怎样”——的误差就可能被越严重地放大,即使训练误差仍然很小。结论基于可逆非线性观察、Gaussian 潜在状态和线性 Gaussian 动力学等假设,但它清楚划出了一条边界:会预测,不等于学会了可控的世界。