Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.048 — 2026-08-21
PAPER H 8 约 1 分钟

世界模型的随机性,校准了吗

CaliBench反复生成同一场景,检查世界模型给出的物理结果概率是否靠谱。

一段掷骰子视频看起来很真,不代表模型真的懂随机性。让它从同一画面反复生成,如果骰子总落在同一面,单条视频仍可能挑不出毛病,整体概率却明显不对。CaliBench要查的正是这一层:视频世界模型——根据当前画面生成后续变化的模型——给出的各种物理结果及其比例,是否接近真实规律。

研究者设计了九个结果分布已知的场景,包括骰子、纸牌、轮盘和高尔顿板,并把结果归为点数、花色、颜色或落点等直观类别。评测分开看两件事:视频能否产生清楚、可判定的结果;在可判定样本中,结果分布与参考分布相差多远。这样就能区分“画面坏到无法计分”和“画面像真的,但随机概率失真”。

作者测试六款图生视频模型后称,多数“场景—模型”组合存在显著失准,输出概率常集中在少数结果上;极端例子是 Veo 3.1 的骰子场景完全收缩到单一结果。表现也更多随场景变化,没有一款模型包揽九个场景。换句话说,世界模型会生成一种合理未来,还不等于它掌握了合理的未来分布。


供稿材料 SOURCES — 1

← 返回 2026-08-21 · 学术板块