你让 AI 生成一段“在房间里四处走动”的视频。镜头先看沙发,再转向窗户,过一会儿回到原处,沙发的颜色、位置甚至形状可能都变了。问题不只是视频够不够清晰,而是模型没有真正记住自己刚才生成了什么。WorldCrafter 想补上这块短板:给视频世界模型一份可按相机视角查询的隐式 3D 记忆,让它走远再回头时,仍能找回此前见过的世界。
视频世界模型,是一种根据已有画面、文字提示或相机动作继续生成视频的模型,可以充当可互动的环境模拟器。WorldCrafter 由 Wangbo Yu 等人提出。下文的架构、指标与效果均来自论文自身,尚无第三方复现或独立评测。
它记住的不是整段录像
最直接的记忆办法,是把过去生成的画面全部交给模型。但历史越长,计算成本越高。只挑几帧又容易漏掉关键视角。模型内部可处理的 token——可以理解为信息单元——数量有限,不可能把沿途所有画面原样塞进去。
WorldCrafter 换了一个思路。它先用 memory encoder(记忆编码器)把多个历史视角的画面压缩成一组内部表示,再由 pose-conditioned readout module(受相机姿态控制的读取模块)按下一段视频的目标视角,从中取出固定数量的记忆 token。好比不是把整本旅行相册带在身上,而是先说明接下来要看房间的哪个角落,再抽出与那个方向最有关的照片。
这里的“3D 记忆”需要说得谨慎。它不是一张明确保存墙面、物体和深度的三维地图,也不进行完整的几何重建。它是一组从多视角观察中学到的内部数字表示,带有空间结构倾向,可以按新相机位置查询。论文强调,这套机制不依赖显式的深度对应关系。
记忆编码器从预训练的多视角表示编码器 LagerNVS 初始化,因此一开始就带有一定的 3D 归纳偏置——也就是更容易从不同视角中寻找共同空间结构。随后,研究者把记忆编码器、读取模块和视频生成器联合训练,让“怎么记”与“怎么用”一起适配,而不是先做一份固定记忆,再要求生成器勉强读懂。
先问要去哪,再决定回忆什么
论文比较了两种读取方式。pose-free readout 不看下一步的相机轨迹,直接把历史压成固定数量的 token;pose-guided readout 则先参考即将到来的目标视角,再提取相关信息。在相同 token 预算下,后者的重访一致性和相机控制都更好。
历史画面的选择也不是简单寻找“最像目标视角”的几帧。WorldCrafter 保留最近一帧,再挑选能互相补充、共同覆盖目标区域的历史视角。消融实验中,把这种最大覆盖策略换成逐帧相似度排序后,重访指标 LPIPS 从 0.255 升至 0.296;该指标越低,代表重访画面与初次画面越接近。相机姿态综合误差 CamMC 也从 1.546 升至 1.664,同样是越低越好。
模型还同时保留近期视频上下文。长期记忆负责回答“这里原来是什么样”,近期上下文负责延续眼前正在发生的运动。生成的新片段会加入历史档案,但记忆编码器的输入规模和交给视频生成器的记忆 token 数量保持固定。
回到原地,少变一次脸
研究者构建了一个包含 145 张起始图像的测试集,其中有 83 个动态场景和 62 个静态场景。每张图配有 5 条相机轨迹,共生成 725 段视频。轨迹长度为 528 至 1648 帧,并特意安排闭环重访,用来检查模型绕一圈回来后,能否保留第一次看到的内容。
与论文所评测的 8 个近期模型相比,WorldCrafter 在重访测试中把 LPIPS 做到 0.255;对照中表现最强的 Lyra 2.0 为 0.487。PSNR——衡量重访画面与原画面接近程度的指标,通常越高越好——则从 Lyra 2.0 的 14.050 dB 提高到 18.016 dB。论文据此认为,模型在重返旧位置时更能恢复此前的外观和结构。
相机控制测试中,完整版 WorldCrafter 在旋转误差、平移误差和 CamMC 三项指标上均为参评模型最低。消融实验也支持“按目标视角读取”的设计:改用不看目标姿态的读取方式后,LPIPS 从 0.255 升至 0.333,旋转误差从 13.536 升至 18.307。
WorldCrafter 还通过 few-step distillation(少步蒸馏,用较少生成步骤模仿原模型)制作了快速版。论文报告,WorldCrafter-fast 在 4 张 GPU 上可达到每秒 16 帧,并支持从单张图片或文字提示开始的流式探索。它在重访指标上甚至优于完整版,但三项相机控制指标均排第三,显示提速并非所有维度都同步提升。
为什么值得关注
这项工作的重点不是单纯把视频做长,而是让长视频共享一份持续存在的场景状态。只延长生成时间,模型仍可能不断重画世界;只有当历史观察能被压缩、保存,并按当前视角准确取回,互动式探索才更像在同一个地方移动。
它也展示了一种务实取舍:不先建造完整的显式 3D 地图,而是在有限 token 预算中保存对生成最有用的空间与外观信息。论文给出的组件计时中,基于深度估计和画面变换的空间记忆每个片段需 1.346 秒;WorldCrafter 的记忆编码与读取合计为 0.062 秒。不过,这只是论文设定下的组件耗时比较,不能直接等同于端到端速度优势。
局限与未知
- 作者承认,面对特别复杂或更长的相机轨迹,一致性仍可能失效。“有记忆”不等于已经得到不会变化的世界。
- 当前系统会在每个视频片段重新编码历史,因此仍有额外延迟。论文把增量更新的流式记忆编码器列为后续方向。
- 所有结果均来自论文自己的基准与评测流程。目前缺少第三方复现,也无法据此判断它在更多场景、设备和交互条件下是否保持同等效果。