Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER HF 82 约 6 分钟

世界模型不能只猜中一种未来

PAWBench不只看视频像不像,还追问模型是否按正确概率生成多种可能未来。

你把一枚硬币放在桌上,让 AI 接着生成“抛起再落下”的视频。它连续做出十段画面,每段都很逼真,却有九段正面朝上。问题就来了:它究竟学会了硬币可能怎样落下,还是只学会了一种看起来像真的结局?PAWBench 要检查的正是后者。它不只问一条视频是否合理,还问模型反复预测时,各种未来出现的比例是否合理。

这项工作的对象是视频世界模型——根据已有画面和动作生成未来视频、借此模拟环境接下来会发生什么的模型。论文把更严格的要求称为“概率对齐”(Probabilistic Alignment):同一个起点、同一个动作之下,模型既要覆盖各种有效结局,也要让它们以接近参考概率的频率出现。以下结果均来自 PAWBench 论文自身的实验,尚无独立信源交叉验证。

会拍一条好视频,还不等于理解世界

过去常见的评测以单条视频为单位,检查画面质量、时间连贯性、动作一致性或物理合理性。但一次生成只能证明模型会讲出一个合理故事。

假设某个杯子落到桌面后,九成会站稳,一成会倾倒。一个模型即使两种视频都会生成,如果各占一半,也没有学对这个过程。反过来,它若总让杯子站稳,整体比例可能看着接近,却漏掉了少见但有效的倾倒结局。

这对应两种不同能力。第一种是“覆盖”:模型能否找全有效未来。第二种是“概率质量对齐”:它给每种未来分配的概率是否正确。多样不等于对齐;能生成许多不同画面,也不代表它理解了这些结局各有多常见。

把模型当成一枚反复投掷的骰子

PAWBench 固定初始图片和动作提示,让模型对同一条件重复生成视频。配套协议 PAWEval 再把每条视频归入有限的终局类别,由此得到一份经验概率分布。无法看清结局或不符合预设类别的视频单独记为“结果读取失败”,不硬塞进某个物理结果。

基准共含 50 个场景,覆盖八类物理机制,并拆成两组。

PAW-Calibration 有 25 个场景,用于检查概率是否校准。它选择能够通过解析推导或对称性得到参考概率的过程,例如抛掷、旋转和路径分流。模型分布与参考分布之间用总变差距离(TVD)衡量;数值越低,两者越接近。

PAW-Coverage 也有 25 个场景,用于检查有效结局的覆盖率。这里可以列出可能结果,却无法可靠指定每种结果的概率,例如保龄球滚动、瓶子翻转、碰撞或材料变化。研究因此只问模型找回了多少种有效未来,不假装知道精确比例。

这套拆分很重要。它避免用一个总分掩盖两种问题:模型可能结局很多但比例错误,也可能比例看似不错却遗漏有效分支。

11 个系统,没有一个同时过三关

研究评测了 11 个视频生成系统。论文的结论不是“所有模型在所有场景都失败”,而是没有一个系统能同时做到三件事:概率准确、有效未来覆盖广,并且在不同场景中可靠地产生可判读结果。

例如,Cosmos 3 Super I2V 的校准 TVD 最低,为 20.5,但校准组只有 80% 的场景通过结果读取门槛。LTX-2.3 的覆盖率最高,为 71.7%,可这个平均数只来自覆盖组中通过门槛的 72% 场景。Seedance 2 在校准组的场景通过率达到 100%,其 TVD 却是 30.5,并非最低。换句话说,“视频能顺利完成并看清结局”和“结局分布正确”是两项不同能力。

研究还检查了差距是否只是样本太少或自动评审不准。把生成次数加倍后,校准结果大体不变,部分模型的覆盖率继续提高:多抽几次可以发现新结局,却不会自动修正原有的比例偏差。11 个生成器的平均 TVD 为 31.2;按参考分布模拟同等样本量时,99% 的模拟结果低于 9.22。对双方都能明确判断终局的 888 条视频,PAWEval 与七人评审组的决定性标签在 722 条上相同,一致率为 81.3%。这些检查不能证明评测完美,但说明主要差距很难只归咎于有限采样或自动判读。

能操控结局,不等于能操控概率

论文继续测试三种干预。

第一种是语言提示:先点名想要的未来,再让视频模型生成。直接指定目标的 Oracle PE 能降低 TVD、提高覆盖率,但生成器真正实现指定结果的比例仍只有 37.6%—58.1%。控制单条视频已经不稳,更谈不上稳定复现整份概率分布。

第二种是初始噪声采样。研究采用 C2C,让一批初始噪声彼此更分散,以减少有限预算下反复撞上同一种结果。它在三个生成器上都降低了通过场景的平均 TVD,并提高平均覆盖率,但没有稳定提高场景通过率。它更像是把模型已有的可能性翻得更开,并未改写模型学到的分布。

第三种是训练。研究用不同比例的“铅笔向左或向右倒下”视频微调 Wan2.2。左倒训练样本越多,模型在两种测试场景中都越常生成左倒,但变化并不与训练比例一一对应。更关键的是,同一次调整会把直立铅笔和左倾铅笔的预测一起推向同一方向:改善一个场景,可能恶化另一个。模型学到的是粗糙的全局偏好,还没有可靠地根据每个场景的物理状态调整概率。

为什么值得关注

如果世界模型要参与互动或规划,只生成“一个说得通的未来”远远不够。决策既取决于可能发生什么,也取决于各自有多大机会发生。罕见风险若被漏掉,规划会过于乐观;罕见结果若被夸大,系统又会把例外当成常态。

PAWBench 的价值,是把讨论从“视频像不像现实”推进到“反复生成的统计规律像不像现实”。它也给出了一个克制的判断:当前模型可以生成合理、多样甚至可控的未来,但这些能力本身不能证明模型学对了世界的不确定性。

局限与未知

  • PAWBench把视频归纳为终局标签,便于统计,却没有完整检查中间运动过程和轨迹级动力学。
  • 评测依赖有限次数的重复生成;增加样本能更可靠地估计分布,也会显著增加成本。
  • 场景经过控制且便于视觉判读,结论尚不能直接外推到更长时间、持续交互或具身环境。

供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块