Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER HF 178 约 6 分钟

遮住物体后,世界模型还记得吗

用150类遮挡与碰撞任务追问:视频模型能否记住看不见的物体,并把这种常识练出来。

你看见一只球滚到屏风后面,会自然地等它从另一边出来。球没有因为看不见就消失,也不该突然换颜色、改数量,或穿过墙壁。视频模型却常在这里露馅:画面可以很逼真,背后的世界却未必连续。

论文《Training Object Permanence in World Models》瞄准的正是这道基础题。研究团队构建了 WROP(World Reasoning with Object Permanence),既用来考试,也用来训练模型。它不只问模型有没有“物体恒存”——理解物体被遮住后仍然存在——还加入“实体性”:实体通常不能互相穿透,也不能无缘无故占据同一空间。论文把视频生成模型归入“世界模型”,即通过生成后续画面来模拟环境变化的模型;这是作者采用的范畴,并不等于模型已经真正理解世界。

本文数字与效果均来自研究团队披露,尚无独立复现。

把婴儿认知实验改造成模型考场

WROP 包含 150 个手工设计的 Blender 三维场景生成器,分成六类任务。其中三类考物体恒存:物体穿过遮挡物后能否保持身份、大小和方向;屏风移开后,原有物体的数量和位置是否不变;物体藏进移动或交换位置的容器后,模型能否继续追踪它。

另三类考实体性:物体能否穿过尺寸合适的开口;支撑被抽走后是否下落,并由下方开口大小决定通过或停住;多个物体碰撞后,是否保持数量和身份,并产生合理的后续轨迹。

这套设计的关键,是把“认知结构”和“画面表象”分开。速度、灯光、材质、颜色和相机角度可以随机变化,但遮挡、容器移动或碰撞所考查的物理关系保持不变。好比同一道应用题不断更换人物和场景,模型若只记住某种颜色或构图,就很难蒙混过关。

每个生成器提供 10,000 个训练样本,总计 150 万个;考试集则有 300 道题,每个生成器取两题。每段样本是 120 帧、24 fps 的动画,关键事件前后各 60 帧。模型只能看到前半段和文字提示,再生成包含事件及其后果的后半段。样本还附带逐帧物体轨迹和场景状态记录。

这里没有使用刚体物理引擎自动算运动。研究者用 Blender 关键帧直接编排轨迹,以便精确控制遮挡、接触和重现发生的时间。代价是,物理可信度依赖场景作者,而不是模拟器自动保证。团队对文件完整性和帧数做了自动检查,也从每个生成器抽取代表样本人工检查。

不只测常识,还把常识练进去

研究团队从 Cosmos3-Nano 微调出一个 16B 模型 PWM-WROP。所谓微调,是在已有模型上继续训练,让它适应特定能力。模型结构和 tokenizer——把输入拆成模型可处理单位的组件——都没有改变,变化的是训练数据和训练信号。

PWM-WROP 用全部 150 万个样本训练一个 epoch,也就是完整看过训练集一遍。它接收前段视频和文字提示,预测后续 60 帧;训练中没有额外提供任务类别名称。换句话说,团队想把“物体仍在”“容器移动时内容物也随之移动”“实体不能穿透”变成生成后续画面时可直接使用的认知先验,而不是一道答题规则。

这比单纯做排行榜更值得注意。逼真的视频可能只是复制常见画面规律;WROP 则试图让模型在物体完全不可见时,仍维护一个稳定的内部世界状态。若这一步不存在,后续的碰撞、支撑变化和因果结果也容易建立在错误场景上。

排名不错,但还不能叫“真正理解”

团队共评测 14 个模型,包括 4 个真正续写输入视频的 continuation 模型、3 个根据参考视频重新生成事件的 reference-to-video 模型,以及 7 个在原时间段重绘画面的 edit/transfer 模型。三类接口面对的难度不同:重新生成场景的模型有更大自由度,而真正续写的模型必须从输入最后一帧接下去。

主要评估采用盲测两两比较。20 名众包评审同时考虑文字一致性、运动与物理可信度,以及物体是否消失、凭空出现、穿墙或改变颜色、形状和数量。团队用 Bradley–Terry 模型把比较结果换算成 Elo 分数——一种从两两胜负估计相对强弱的评分。

按论文报告,PWM-WROP 得到 1679.5 Elo,在 continuation 模型中第一、总榜第三。前两名 Wan 3.0 Prime 和 MiniMax H3 均为 1723.6,作者称两者在统计上并列。下一名 continuation 模型 Grok Imagine 为 1457.0,差距约 224 Elo。不过,模型的架构和接口也不同,因此不能把差距全部归因于 WROP 训练。

分项结果也更克制。PWM-WROP 在“静态物体被移动屏风遮住”任务中排名第一,三个物体恒存类别分别排第一、第三、第三;但在三个实体性类别中分别排第五、第二和第八,碰撞尤其薄弱。这说明针对性训练更明显地帮助了遮挡追踪,还没有同样解决接触与碰撞动力学。

为什么值得关注

这项工作的价值,不是证明模型已经获得类人认知,而是把一个含糊的问题改造成可训练、可检查的实验:遮挡前是什么,遮挡后应该是什么,中间哪些表面因素可以变化,都被明确控制。

它也提醒我们区分两件事:视频看起来连贯,不代表模型一直记得场景里有哪些物体;考试得分提高,也不等于内部已经形成了人类式概念。更稳妥的结论是,结构化合成数据可能改善特定物理一致性,而且不同能力——遮挡追踪、容器定位、碰撞结果——未必会一起出现。

局限与未知

  • 主要人评只包含 361 次不同模型之间的两两判断,每个模型约 50—52 场;虽然论文给出按评审聚类的 bootstrap 区间,但证据规模仍有限。
  • PWM-WROP 是唯一用 WROP 数据训练的模型,且各模型结构、接口和输出方式不同,因此实验不能单独隔离训练数据的因果贡献。
  • 论文称数据、考试集、答案、评分、权重及 AWS Trainium2 上的原生 PyTorch 训练栈 PWM 均已发布,但现有材料不足以确认这些内容及许可证是否都可实际下载。

供稿材料 SOURCES — 1

← 返回 2026-09-26 · 学术板块