Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
PAPER HF 114 约 1 分钟

世界模型评测开始让Agent写判词

HarnessEval-W让评测Agent查证并写出判词,让世界模型的分数有据可查。

看一段 AI 生成的影片,人很容易发现汽车相撞后毫无反应,或物体转眼消失;但把这种“不合理”压成一个分数,往往说不清究竟错在哪。HarnessEval-W 想让评测系统像 Agent 一样办案:先理解场景,再拆分问题、调用检查工具,最后给出带证据的判词,而不只报一个排名数字。

最具体的一步是分工查证。遇到碰撞,系统会让不同子 Agent 追踪物体边界框、核对相交时刻并估算速度,再由上层 Agent 验证证据、汇总结论,形成可检查的“证据树”。作者将基准分为画面呈现、状态转变和长期延续三方面,共设置 330 个案例,评测 18 个代表性世界模型——世界模型会从初始场景连续生成未来,像播放一段它想象中的影片。作者称,其排序与人类偏好较为一致;不过论文摘录未披露具体一致率。真正值得注意的是评测观念的变化:当错误涉及物理、因果和状态延续,一个自动分数已不够,系统还得解释自己为何这样判。


供稿材料 SOURCES — 1
01
HarnessEval-W: Agentifying the Evaluation of Visual Worlds arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-21 · 学术板块