看一段 AI 生成的影片,人很容易发现汽车相撞后毫无反应,或物体转眼消失;但把这种“不合理”压成一个分数,往往说不清究竟错在哪。HarnessEval-W 想让评测系统像 Agent 一样办案:先理解场景,再拆分问题、调用检查工具,最后给出带证据的判词,而不只报一个排名数字。
最具体的一步是分工查证。遇到碰撞,系统会让不同子 Agent 追踪物体边界框、核对相交时刻并估算速度,再由上层 Agent 验证证据、汇总结论,形成可检查的“证据树”。作者将基准分为画面呈现、状态转变和长期延续三方面,共设置 330 个案例,评测 18 个代表性世界模型——世界模型会从初始场景连续生成未来,像播放一段它想象中的影片。作者称,其排序与人类偏好较为一致;不过论文摘录未披露具体一致率。真正值得注意的是评测观念的变化:当错误涉及物理、因果和状态延续,一个自动分数已不够,系统还得解释自己为何这样判。