Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.034 — 2026-08-07
PAPER H 4 · HF 30 约 6 分钟

WorldExam:世界模型不能只看画面

WorldExam 不只看视频像不像真,还追问:AI 的世界会不会对动作作出合理反应。

你让 AI 生成一段“人向前走”的视频。画面很漂亮,人也确实往前走了。但如果前面有台阶,他仍像在平地上滑行;如果撞到箱子,箱子纹丝不动。这样的模型会拍视频,却未必理解这个世界该怎样回应动作。

WorldExam 正是要测出这层差别。它是一套评测基准——也就是统一的测试题、评分规则和对比流程。作者认为,当可控视频生成器被称为“世界模型”时,只检查画面是否逼真、指令有没有执行,已经不够。世界模型是环境变化规律的内部模拟器,真正关键的问题是:给它一个动作之后,它能否推断接下来应该发生什么。

这篇论文的所有结果目前都来自 WorldExam 作者自己的实验,尚无独立复现。下文的比较也不宜外推到所有模型。

从“照着画”到“自己推断后果”

可控视频生成,是让模型根据文字、动作或相机轨迹生成后续视频。过去的许多测试会问:镜头是否按要求向右转,人是否按指令向前走,提示里点名的结果是否出现。

问题在于,这些测试常把答案一并告诉模型。比如提示直接写“人撞到纸箱,纸箱倒下”,模型只需把指定结果画出来。WorldExam 刻意拿走后半句:它只要求人向前走,让模型根据初始画面自行判断,人会不会碰到箱子,箱子又该如何反应。

作者把这种能力称为“内在反应性”(Inherent Reactivity)。这是 WorldExam 提出的评测框架,并非业界已经统一的标准。它关注输入没有明说、但场景状态自然要求出现的后果。

论文列出的例子很直观:主体走上楼梯时,高度和步态应随地形变化;接近障碍物时,应发生接触、避让或受阻;进入另一个人的近身空间时,对方也应作出合理回应。模型不能只让受控主体动起来,还要让周围世界“接住”这个动作。

四层考试,八类题目

WorldExam 收录 1,474 个案例,分成八项任务,并把能力拆成四层。

第一层是 Visual Quality,即视觉质量:画面是否可信、稳定、美观。第二层是 Control Adherence,即控制遵循:相机或主体是否真的按输入行动。第三层是 Spatial Consistency,即空间一致性:镜头离开后再回到原处,场景的几何、外观和内容能否保持一致。

第四层才是重点:World Reactivity,即世界反应性。它包括五类题目:地形交互、物体交互、社会交互、物理反应和目标完成。前三层回答“视频有没有生成对”,第四层追问“这个世界有没有反应对”。

其中,目标完成不规定逐帧步骤,只给一个高层目标。例如,把三颗螺栓按高度排列。模型需要从画面里找对物体,忽略干扰项,自行决定先移动哪一颗,以及怎样一步步完成。这比复述一条详细操作指令更接近对环境的规划和执行。

测试案例也尽量避免把答案泄露给模型。用于动态交互的初始画面经过人工筛选:相关物体必须可见,空间布局必须允许事件发生,但画面不能已经展示待测结果。之后,系统再根据选中的图片校正人物、物体和空间关系。最终给模型的仍只有动作或目标,预期反应不会被明说。

三种模型,先把接口翻译成同一道题

不同世界模型接收的控制方式并不一样。camera-driven 模型读取相机轨迹;action-driven 模型接收类似键盘按键的离散动作;language-driven 模型读取自然语言提示。直接比较它们,像是让三名考生分别用方向盘、键盘和口头指令答题。

WorldExam 的做法是先把行为拆成“向前移动”“向右转”等原子控制单元,再翻译成各模型原生的输入形式。这样,三类模型面对的是相同的控制意图,而不是完全不同的题目。

它也没有强行做一个总榜。基准分成两条赛道:静态场景赛道测试相机控制和返回原视角,三类模型都可参加;动态交互赛道要求主体与环境发生可见互动,只比较接口兼容的 action-driven 和 language-driven 模型。目标完成则只适用于语言控制。这个设计避免把接口根本不支持的任务直接算成模型失败。

评分也按问题拆开。相机、主体和地形运动会先从视频中重建为三维轨迹,再检查方向、返回位置和高度变化。物体交互、社会交互、物理反应与目标完成难以只靠轨迹判断,因此论文使用 GPT-5.5 作为视觉语言模型裁判:它查看均匀抽取的 10 帧画面,逐项核对预先固定的清单。缺失、模糊、离开画面或无法验证的证据都算未满足。

漂亮和听话,都不等于懂世界

作者评测了 20 个代表性模型,观察到三种控制范式各有明显短板。camera-driven 模型更擅长相机控制,但其评测接口不支持动态交互;这描述的是接口与任务的适配范围,不能直接理解成模型绝对没有交互能力。action-driven 模型对主体控制更精确,却常让周围环境没有响应。language-driven 模型在交互任务上表现较好,但更难严格遵循复杂控制。

更重要的结论是:高视觉质量和显式指令履行,并不能保证内在反应性。被测模型中,没有一个同时覆盖广泛任务并持续保持强表现。换句话说,一段视频可以很好看,也可以把命令中的动作画得很准,却仍在动作与后果之间露出空白。

这正是 WorldExam 值得关注的地方。它没有再问“哪段视频最像真的”,而是把问题推进到“这个生成出来的世界是否真的会运转”。如果世界模型将来要承担预测、交互或目标执行,仅靠漂亮画面显然无法证明它理解了环境变化。

局限与未知

  • 论文材料没有完整给出 20 个模型的名单、各任务分数和统计显著性,因此目前无法量化三类范式之间究竟差多少,也不能判断“代表性模型”的选择是否充分。
  • 四类语义任务依赖 GPT-5.5 按 10 帧画面判分。论文说明了清单和失败规则,但现有材料没有提供裁判与人工判断的一致性结果。
  • 1,474 个案例覆盖多种视角、主体和场景,但基准表现仍不等同于开放世界中的普遍能力。WorldExam 更适合作为故障定位工具,而不是给世界模型能力下一个总判决。

供稿材料 SOURCES — 1

← 返回 2026-08-07 · 学术板块