就像导航把沿途景物画得很准,却把岔路口标反了:AI 预测下一幕时误差很低,不代表它能选对动作。两项研究共同追问潜在世界模型——先把环境压缩成内部状态,再推演动作后果——为何会在“看准未来”和“做好规划”之间掉链子。
Wang 等人发现,某些邻近的备选动作在模型里预测误差更低,实际执行后却离目标更远。他们提出 Action–Consequence Alignment(ACA,动作—后果对齐):从每条真实记录附近找出这种会误导规划的动作,并在训练中压低其虚假优势;作者称,该方法无需增加模型组件或离线训练阶段的环境交互,并在所有受测环境中改善了规划表现。
Min 等人则把误差拆开看。四类模型、四项任务的 16 种组合中,有 14 种的均方误差主要来自候选动作共有的整体偏移;但其中 6 种里,修正决定动作排序的相对响应,反而比修正最大误差源更能改善选择。说白了,误差最大处未必是决策最要紧处;表征、预测与规划应分开检查。