想象机械臂在晃动的镜头前按按钮:画面里最显眼的是整体摇晃,模型反而看不清机械臂做了什么。这正是世界模型的“动作失明”——它在压缩后的内部状态里预测未来,却被背景动态带偏,给不同动作算出近乎相同的结果。论文还发现,这种失灵很隐蔽:验证损失仍会改善;在 Atari Freeway 上,按验证损失挑选模型时,36 次运行中有 17 次选中了动作通道已经坍缩的检查点。
作者提出的 AD-JEPA 借用 Dueling 分解:先算各动作预测的平均效果,再从每个动作的预测中减掉这部分。镜头晃动、云层移动等所有动作共有的“公共运动”会被抵消,剩下的才是该动作额外造成的变化。关键在于,这只是读取预测时的一次减法,无需奖励、画面重建或额外训练目标,也能事后用于冻结的 RePo、TIA 等现成模型。作者称,在多类实验中,分离后的通道恢复了智能体自身影响,干扰泄漏与零无显著差别;但若干扰会随动作同步变化,它就不再是公共模式,这套方法也无法滤掉。