Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER H 7 · HF 11 约 6 分钟

WorldCycle:世界模型学会自证未来

WorldCycle让视频世界模型用可逆动作闭环自查,专治长时预测越走越偏。

你让一个视频 AI 模拟“向前走、左转、再原路返回”。每一步单看都可能像模像样,最后却回不到原来的位置:墙面偏了,颜色变了,物体布局也慢慢走样。问题不只是哪一帧画错,而是早期的小误差被后续预测反复继承,最终滚成明显偏差。

WorldCycle 想解决的正是这件事。它让模型执行一套可以返回起点的动作,再用“到底有没有回来”自动验算长时预测,无需为每条轨迹准备真实视频。论文报告,它最多把状态返回漂移降低 44%,并把分布外复合动作的准确率提升到基础模型的近 4 倍。不过,这些结果均来自作者论文,尚无独立复现。

没有标准答案,就把题目改成可以验算的

视频世界模型——根据当前画面和动作预测世界接下来会怎样——常采用自回归生成:模型把自己刚生成的画面,当作预测下一段的依据。这很像传话游戏。一个细小的位置偏差,会进入下一轮输入,再被继续放大。这就是误差累积。

强化学习可以在生成后给模型奖励,引导它改进。但长时视频有一个麻烦:任意执行一串动作后,正确的未来画面通常不存在,系统无法自动判分。此前方法更多检查短片段是否遵循动作、画面是否好看,却难以判断整条轨迹最终偏了多远。

WorldCycle 换了一个角度:不要先处理所有动作,只看可逆动作。假设镜头向前移动,再执行对应的反向移动,理论上应回到起点。起始画面于是成了现成答案。论文把这种结构称为可逆动作循环,并据此构造“可自验证强化学习”——奖励是否正确,不靠人工标注,而由动作闭环自动给出。

不只检查终点,还沿路对账

只看最后有没有回到起点,信号仍然太稀疏。模型知道整趟旅程出了错,却不知道错误从哪里开始。

WorldCycle 因此设计了 spatial closure reward,即“空间闭合奖励”。一段正向动作后接完全对应的逆向动作,前后两半天然形成镜像。正向途中经过的每个状态,都应在返程相应位置再次出现。系统逐段比较这些画面,用图像中的稠密点跟踪——追踪大量对应像素的位置——衡量两帧之间的偏移。这样,每个中间片段都变成一道可以自动验算的小题。

第二种奖励叫 temporal consistency reward,即“时间一致性奖励”。系统把同一循环重复多次,并比较各轮相同阶段的画面。如果状态和动作相同,下一步变化也应相同。论文以第一轮为固定参照,避免比较基准跟着模型一起漂移。前一种奖励管“一圈能否闭合”,后一种管“多跑几圈会不会变形”。

训练时,作者先只使用空间闭合奖励,让单次循环基本站稳;随后保留它,再加入时间一致性奖励。消融实验——移除或更换某个组件以观察影响——支持这一安排:只用空间奖励时,381 帧长时设置的终点闭合误差 ESC 为 0.212;完整方法降至 0.163。若一开始同时加入两种奖励,或后期完全切换到时间奖励,整体表现也不如先预热、再联合训练。

为了防止模型只记住“走到固定时间就反向”,训练还会采样不同长度的循环。最终奖励同时保留动作跟随与画面质量信号,避免模型为了轻松闭环,生成缺乏有效内容的画面。

真正有意思的是,它能教没有示范的动作

WorldCycle 从 8B 参数的 WorldPlay 自回归模型出发,使用约 4000 组真实场景图像—文字对进行后训练。闭合循环在训练时即时构造,不需要人工标注循环视频。训练持续 3 天,使用 8 张 H200 GPU。

作者还发布了 CycleBench,用来专门检查模型能否返回正确状态。它包含 380 个初始画面、47 条动作轨迹,覆盖可逆循环、非原路闭合、重复循环和级联循环,并设置 125、253、381 帧及复合动作等条件。ESC 衡量终点与起点的距离;RPS 衡量去程与返程的镜像偏差;RCS 衡量多轮循环相同阶段的漂移。数值越低,闭环越稳定。

在短时简单动作上,相比同样由 WorldPlay 初始化、但主要奖励短片段动作跟随的 WorldCompass,WorldCycle 将 ESC 从 0.038 降至 0.026,RPS 从 0.034 降至 0.019,分别改善 32% 和 44%;动作准确率则接近,分别为 0.833 和 0.829。到 381 帧时,WorldCycle 的 RCS 为 0.049,相比 WorldCompass 的 0.074低 34%。这说明收益并不只体现在最后一帧,而是延伸到了重复循环的稳定性。

更值得注意的是复合动作,比如一边前进一边转向。这类组合在基础模型的预训练分布中较少出现。WorldPlay 在该设置下的动作准确率只有 0.136,WorldCycle 达到 0.553,约为前者 4 倍,也高于 WorldCompass 的 0.499。关键在于,即使没有对应的真实视频示范,只要组合动作及其逆操作仍能构成闭环,模型就能获得自动反馈。

为什么值得关注

这项工作的价值不只是又做出一个更稳的视频生成器。它提供了一种训练思路:当真实未来无法取得时,可以利用动作本身的结构制造标准答案。模型不必知道开放轨迹的每一帧应该长什么样,只需先证明一套可逆操作执行完后,状态确实回来了。

这也把评估重点从“单段视频看起来是否合理”,推进到“模型是否像一个一致的状态转换系统”。对于需要连续规划和探索的世界模型,后者更接近真正的瓶颈。

局限与未知

  • 闭环成立有严格前提。动作必须确实可逆,环境也要近似确定;碰撞、随机变化、不可逆交互或隐藏状态改变,都可能让“回到起点”本身不再是正确答案。
  • 44% 和近 4 倍都是作者在特定设置中的最佳概括,不能视为所有场景的普遍提升。CycleBench 与模型发布情况目前也只有论文自述,材料未提供第三方使用或复现记录。
  • 方法目前聚焦可逆视觉运动。论文把近似可逆过程和机器人操作列为后续方向,但尚未给出相应实验。

供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块