你按下前进键,画面却过了半秒才动;鼠标已经转向,镜头还在沿旧方向滑。这样的 AI 游戏世界即使看起来逼真,也谈不上真正可玩。ForgeWM 要解决的正是这个问题:让模型一边预测接下来的画面,一边及时、可靠地服从键盘和鼠标操作。
它面对的是“动作条件视频世界模型”——根据当前画面和玩家动作预测后续视频,相当于不靠显式图形引擎,在模型内部运行一个会响应操作的游戏环境。ForgeWM 把原本需要反复计算的生成过程压缩到稳态一次、两次或四次去噪,并为不同预算分别训练模型。论文作者在 Minecraft 配对轨迹上报告了更低延迟和更好的综合画质、运动与控制指标。不过,以下结果均来自作者团队的单篇论文,尚无独立复现。
难点不只是把画面算快
这类模型通常采用扩散式生成。它像从满屏雪花中反复擦出清晰画面,多做几轮往往更稳,但互动延迟也随之增加。少步生成试图把这个过程浓缩到一次或几次,代价是每次失误都更容易进入下一段视频。
在线互动还必须遵守“因果生成”:预测当前画面时只能看已经发生的内容,不能偷看未来。训练素材却是完整视频,模型很容易习惯同时参考前后帧。真正运行时,它看到的又不再是干净的真实历史,而是自己刚生成、可能已有偏差的画面。画面误差、动作错位和内部缓存偏差会一起滚入后续片段。
控制信号也比一句文字提示更苛刻。键盘是离散状态,例如前进键是否按下;鼠标是连续位移。它们按视频帧到来,必须与压缩后的视频表示准确对齐。ForgeWM 的 VAE——把画面压缩为便于计算的内部表示的编码器——每四帧压成一个 latent frame;每个因果片段包含三个 latent frame,也就是十二帧视频。模型为键盘、鼠标和视觉信息分别维护缓存,让每段画面都拿到对应的动作窗口。
四步训练,逐渐撤掉“安全网”
ForgeWM 没有直接逼模型学会一步互动,而是分四个阶段逐渐增加难度。
第一阶段做 domain adaptation,也就是让原始双向视频生成器适应目标游戏。此时模型能同时查看一个训练片段的前后内容,先学会 Minecraft 的视觉和控制规律。这个版本随后成为监督学生的双向老师。
第二阶段改成 teacher-forced causal training。模型只能按时间顺序生成,但历史画面仍由真实数据提供。这像让学车的人上路练习,同时由教练保证此前每一步都没有开偏:模型先掌握因果执行方式,不必立刻承担自己错误的后果。
第三阶段进行 causal consistency distillation。蒸馏就是让更快的“学生”模仿较慢但能力更强的“老师”。老师把一次去噪推进后的结果交给学生,学生学习用更少计算抵达相近位置。论文称,这一阶段不需要预先制作完整的离线生成轨迹。
最后进入 on-policy distribution matching:学生真正用自己的历史连续生成,老师再帮助校正其输出分布。这里撤掉了最后一层安全网。学生必须面对自己产生的偏差,训练情形因此更接近实际互动。
作者分别训练了稳态预算为 1、2、4 次去噪的学生模型。这里的“一步”不是整段视频总共只运行模型一次。ForgeWM-1 和 ForgeWM-2 的首个生成片段仍固定使用四次去噪,此后的每个片段才分别使用一次或两次;ForgeWM-4 则始终使用四次。
快多少,控制又怎样?
作者用 40,000 个 GF-Minecraft 片段训练模型,并与 Matrix-Game 2.0、HY-WorldPlay 比较。评测采用共享初始画面和控制信号的 77 帧 rollout——也就是让模型连续向后生成;参考对齐指标覆盖 1,000 条配对轨迹。
ForgeWM-1 的非初始片段平均采样延迟为 168.2 毫秒,吞吐量为 72.10 FPS。Matrix-Game 2.0 分别是 370.9 毫秒和 32.35 FPS;HY-WorldPlay 是 2164.3 毫秒和 7.54 FPS。按作者给出的统一推理口径,ForgeWM-1 的延迟约为 Matrix-Game 2.0 的 45%。这些时间不包括模型加载、VAE 解码和文件写入,因此不能直接等同于完整产品的端到端延迟。
控制方面,ForgeWM-2 和 ForgeWM-4 的 KCtrl 都达到 0.9740。KCtrl 用方向相反的动作对检查镜头运动符号是否正确;两项基线分别为 0.9156 和 0.9286。鼠标控制准确率最高的是 ForgeWM-2,为 0.8268;Matrix-Game 2.0 为 0.7061,HY-WorldPlay 为 0.5818。
画质并未随着去噪次数单调上升。ForgeWM-2 的 Imaging Quality 为 0.6865,高于 ForgeWM-1 的 0.6776 和 ForgeWM-4 的 0.6788;ForgeWM-4 则取得最低的参考 LPIPS 0.6168。LPIPS 衡量生成画面与参考画面在感知特征上的距离,通常越低越接近。这说明“多算几步”不必然让同一种能力全面改善,也解释了为何作者为不同预算分别训练模型。
先低延迟互动,再精修同一次经历
ForgeWM 还有一条颇实用的双路径。互动时先用一步模型生成低延迟草稿;结束后,再给保存的草稿加入适量噪声,沿着记录下来的动作和已经精修的前文逐段处理。它不是从随机噪声重新生成一段相似视频,而是尽量保留玩家刚刚经历的视角和场景布局。
作者报告,未经精修的一步草稿参考 LPIPS 为 0.6532,回放精修后降到 0.6155,与 ForgeWM-4 从噪声生成的 0.6168 接近。与此同时,精修结果与原草稿的 LPIPS 距离为 0.1970,而从噪声重新生成是 0.6187。换句话说,在这项指标和实验设置下,回放版本达到相近参考质量,同时约三倍贴近原有经历。它仍使用冻结的 ForgeWM-1,不需要另训专用精修器,而且不增加在线互动阶段的计算。
为什么值得关注
世界模型用于互动时,“能生成”只是起点。它还要及时回应操作,并在连续生成中维持动作、画面和历史状态的一致。ForgeWM 的价值不在于单独刷新某个画质分数,而在于把训练和部署围绕这组相互牵制的要求重新排好:先学领域,再学时间顺序,然后压缩生成步数,最后用自身输出暴露并修正滚动误差。
作者还把同一套四阶段流程迁移到由手柄控制的 FPS 游戏,使用双摇杆和射击、瞄准、跳跃等离散按钮,得到独立训练的四步因果模型。这说明作者完成了另一种控制空间的迁移实验,但 Minecraft 与 FPS 使用不同数据和评测协议,不能据此推断它已经普遍适用于各类游戏。
局限与未知
- 主要定量比较集中在受控的 Minecraft 场景。HY-WorldPlay 的控制参数还经过确定性适配器转换,动作尺度可能受到映射方式影响。
- 论文展示的较长 rollout 中,后段仍会逐渐丢失方块结构,或出现扩散的颜色伪影。少步生成降低了延迟,但没有消除长期误差累积。
- 所有优势结论都来自作者自报。当前材料无法独立核验代码和模型是否公开,也没有第三方复现来确认速度、控制与回放精修结果。