自动驾驶系统即使预测“前方可能有变化”,也不等于立刻转向更安全。世界模型——机器用来预演环境变化的内部模拟器——同样会遇到这个问题:它能提出下一步状态,却未必知道执行预测是否优于维持原状。论文指出,变化事件的排序即使接近完美,在绝对误差这套计分规则下,“不动”仍可能是最佳选择。
作者提出 loss-conditioned state execution:先按指定损失生成可执行的候选动作,再用一组独立校准数据,检验它相对保持原状态是否确实降低损失。只有某类场景的收益置信下界仍为正,系统才放行动作;否则暂停。它相当于给世界模型加了一道风险门,而不是逢预测必执行。
据论文自述,在 28,684 条 M4 月度时间序列上,该方法只更新 14.0%,有界损失为 0.588,低于始终不动的 0.599,也低于始终执行的 0.621。保证依赖校准样本独立同分布等假设,覆盖更多场景与认证更稳之间仍需取舍。