同一只方块,轻推时像在粗糙桌面上,重推时却又像在冰面上——两段视频单看都可能合理,放在一起却自相矛盾。对动作条件世界模型来说,这是规划的隐患:模型要先在“脑内”预演不同动作,再从中选择;如果每条未来偷偷换了一套质量或摩擦力,比较就失去了依据。
OneWorld专门约束这种“跨动作物理一致性”。它从同一起点同时生成多个反事实分支——也就是分别假设采取不同动作——再用一个“物理机制解释器”,根据每组动作与结果推断背后的共同物理机制。信息少的分支可以保持不确定,但各分支必须容得下一套共享解释,而不是各说各话。
作者还设计了联合检验:比较各分支单独拟合物理参数,与所有分支共用一组参数时增加了多少误差。在推方块、推绳子和倒水三个受控环境中,作者称 OneWorld 相比 ACWM-DiT 将平均“共享世界差距”降低了 84.3%,同时保持有竞争力的单条预测质量。这个结果提醒我们:画面像真的,只是世界模型可用于可靠规划的起点。