你操纵一个由 AI 即时生成的世界:按下方向键,角色应立刻转弯;再说“走到门边并打开门”,它还得理解这条持续更久的指令。难点不只在听懂。运行一段时间后,门不能换位置,角色不能变脸,画面也不能等半天才响应。WorldPlay2 想同时跨过这三道门槛:多样控制、长期记忆和实时生成。
它属于交互式世界模型——不是一次生成一段固定视频,而是持续接收用户操作,再即时续写后面的画面。论文作者报告,WorldPlay2 在 8 张 H20 GPU 上可达到 16 FPS,并在自建及既有基准中领先。不过,现有证据全部来自论文自身,尚无独立复现或第三方评测。
两种指令,分开处理
世界模型收到的控制并不都长一个样。转向、移动、跳跃等动作要精确对应每一帧;“拿起物体”或“让环境发生变化”则是跨越一段时间的高层意图。这就是异构控制:信号的形式、抽象程度和持续时间都不同。
WorldPlay2 为此设计了 factorized hybrid control interface,即“因子化混合控制接口”。它把控制拆成两路。一路处理逐帧动作,包括相机俯仰与偏航、前后左右移动、视角和跳跃。另一路使用结构化文字描述,并继续分成三个字段:scene 负责场景布局、物体、光照和风格;character 负责角色身份与外观;event 负责物体操作、环境变化等动态事件。
可以把它理解成拍片时分开写三张单子:布景是什么,演员是谁,这一幕发生什么。若全塞进一句描述,模型可能把“角色转身”误学成“背景也要变化”。拆开之后,同一角色、场景和事件可以重新组合,同时保留按键级控制所需的精度。
训练数据也对应这两类能力。作者使用了 70 万段、每段 30 至 60 秒的空间导航视频,以及 1 万段、每段 10 至 30 秒的交互事件视频。后者覆盖环境转换、物体增删和复杂互动。
不背完整录像,只带一份摘要
运行越久,历史画面越多。若模型每次都回看完整录像,计算量和等待时间会迅速上升;但若只看最近几帧,它又容易“失忆”。WorldPlay2 的做法是上下文压缩:把漫长历史浓缩成一小组 memory tokens——可理解为机器内部使用的记忆摘要。
这份摘要同时交给两个模型。teacher 是能力较强、可双向查看片段的教师模型;student 是按时间顺序不断续写、最终负责快速生成的学生模型。让较快的学生模仿较强的教师,叫作蒸馏。
共享记忆带来一个关键变化:教师不必一次处理整段长视频。系统可以把长序列切成短 clip,每段结合此前的压缩记忆单独评分。这样既保留历史条件,也减少长序列蒸馏的负担。论文消融实验中,完整上下文教师每次训练迭代耗时 261 秒,压缩记忆方案为 167 秒;当序列扩展到 320 个 latent——视频在模型内部的压缩表示——前者出现显存不足,后者仍可扩展。
先让学生站稳,再让它长跑
压缩记忆只解决“要记多少”。另一个问题是:学生每次只用很少几步生成,早期小错误会在连续续写中累积,跑得越远,越可能偏离教师。
论文提出 Stable Forcing。第一步是 few-step initialization,即先把学生训练成一个表现尚稳的少步生成器。第二步是 full-rollout replay:向前生成时,每个片段都完整走完少步采样,只把最终结果传给下一段;同时随机保存一个中间去噪步骤,之后再带着梯度重放,用于学习。去噪是模型从噪声逐步还原画面的过程,梯度则是训练时用于调整参数的信号。
这相当于先让学生完整演练长程路线,再抽取其中一个节点复盘,而不是边跑边背着整条计算链。论文称,移除 full-rollout replay 后,长序列质量会逐步下降,最终出现模式坍塌;去掉少步初始化,则更容易产生模糊和网格状伪影。
数字说明了什么
在作者采用的 WBench 导航评测上,完整 WorldPlay2 的综合分为 83.1,超过五个对比模型中最高的 Alaya-Evoke-Turbo(82.0)1.1 分;去掉 Stable Forcing 后为 79.0。论文另建 RevisitBench,用 200 条“离开后再返回”的轨迹考察几何一致性,报告称 WorldPlay2 在相关指标上整体领先。
更明显的差距出现在交互事件测试。作者从 WBench 和自建数据中留出 145 个样例,再由视觉语言模型——能够同时理解图像与文字的模型——自动评估指令遵循和执行准确度。WorldPlay2 平均得分 74.7,次高的 Lingbot-World-V2 为 52.5。这个结果支持“拆分场景、角色和事件有助于控制”的判断,但评分器本身也是自动模型,仍不能等同于人工盲测。
为什么值得关注
WorldPlay2 的价值不只是一项分数领先。它把三个原本容易彼此牵制的问题放在一起设计:控制接口负责听懂不同层级的操作,压缩记忆负责控制历史成本,Stable Forcing 负责让加速后的学生在长程生成中少走样。换句话说,它讨论的已不只是“能不能生成可玩的片段”,而是这种生成世界能否持续响应、记住过去,并承受实际运行的计算成本。
局限与未知
- 论文承认,长时间运行后,角色仍可能发生视觉和语义漂移,无法始终严格保持身份一致。
- 无限时长生成仍未解决;误差累积和长期几何一致性依然是开放问题。
- 16 FPS 依赖 8 张 H20 GPU及多项推理优化。论文未在供稿中给出分辨率、端到端延迟或更低硬件配置下的表现,且全部效果尚待独立验证。