你在一个 AI 生成的世界里走出房间,绕过街角,再回到原地。理想情况是,门还在原来的位置,墙上的画也没有换掉。现实却常常是:模型为了记住一路所见,不断把历史塞进自己的“脑子”,结果越跑越慢;若定期清空历史,它又会忘记来路。
EVOKE 想拆开这个矛盾。它不要求生成模型同时承担“记住整个世界”和“迅速画出下一段画面”两份工作,而是把长期场景状态放进外部存储,再训练一个能用三步完成生成的学生模型。论文把目标称为“endless world”。更准确地说,它展示的是一种单次生成成本不随会话时长增加的设计,而不是已经证明可以无限稳定运行。
别让画师兼任档案管理员
交互式世界模型,可以理解为一个随操作继续生成画面的模拟器。它不像普通视频模型那样一次交出成片,而要根据相机移动、文字指令和当前画面,一段接一段地创造世界。
这类系统通常依赖去噪器(denoiser)——扩散模型里负责把噪声逐步修成画面的网络。为了记住过去,模型可以保留历史画面,或积累 KV cache。KV cache 是模型读过内容后留下的中间计算结果,像一叠不断加厚的草稿纸;它省去重复计算,却会持续占用显存,并可能让后续计算越来越重。
EVOKE换了分工方式。去噪器只拿固定数量的近期历史;更早的场景几何则写入一个按相机位置和朝向索引的 world state bank,也就是“世界状态库”。当镜头回到旧地点,系统从库中挑出与当前视角相关的表面,把它们投影成当前画面可用的像素条件。好比画师只看眼前几张参考图,档案管理员则按拍摄机位取回旧资料。
这个状态库支持读取、写入和淘汰,容量有固定预算。因此,去噪器每次处理的上下文和位置范围不会随着会话变长。代价也很明确:它保存的是预算范围内的几何记忆,并非永久记住所有到访地点。被淘汰的观察不会继续约束之后的生成。
短片看不出的错,要用长片来教
固定上下文解决了“越跑越贵”,却不会自动解决长期漂移。模型可能每一小段都画得合理,但走了很久以后,房子的样式、物体外观或空间布局已悄悄改变。局部看没有破绽,把相隔较远的画面放在一起,问题才显现。
EVOKE因此也改造了教师模型。这里的教师模型,是训练时较慢但能力较强的模型;学生模型通过蒸馏,把教师的能力压缩到更少的生成步骤中。论文认为,如果教师只看短片段,学生就学不到长距离的一致性。
它让教师按视频块处理序列。每一块只查看有限的近邻内容、少量选出的远距离帧,以及一份用 linear attention 汇总的全局状态。Linear attention 是一种避免让每个位置都与所有位置两两比较的注意力计算方式。按论文的分析,这套稀疏注意力让教师的计算量和激活内存随序列长度近似线性增长,而不是二次增长。
训练时,EVOKE使用约 30 秒的完整窗口做 distribution matching,也就是让学生生成结果的整体分布向教师靠近。学生在 self-forced rollout 下训练:它继续读取自己刚生成的内容,而非始终依赖正确答案。这样,早期小错误如何污染后续输入,会真实地暴露出来。论文还把历史在相邻视频块之间断开梯度,因此教师可以联合审视整段轨迹,又不必让反向传播贯穿全部 30 秒。
最终学生每个视频块只做三次去噪,并且不使用 classifier-free guidance(CFG,一种通常要额外计算无条件结果、再加强文字指令影响的方法)。30 秒是训练监督窗口,不是系统的生成上限。
世界还能在途中改剧本
长时间生成不只要求记住旧东西,也要听懂新命令。EVOKE给每个视频块分配独立文字条件,训练序列中就包含提示词切换。运行时,用户可以在途中加入或撤回元素,而不必从头生成整段视频。论文把这种按时间安排指令的能力称为 evocation。
这种设计的重要性在于,响应能力不再只是界面层面的“换一句 prompt”。教师必须先展示:一个正在延续的世界收到新指令后,应当怎样变化;三步学生才有东西可学。外部状态库负责“旧地方是什么样”,长窗口教师负责“世界随时间怎样演化”,两者处理的是不同问题。
成绩不错,但还不是实时
论文报告,在单张 H200、384×640 分辨率下,EVOKE生成一个 1.5 秒视频块需要 2.11 秒,且这一测量包含 world state bank。按数字换算,速度约为实时的 0.71 倍,所以不能称为实时生成;论文所说的“responsive interaction”也没有给出完整的端到端交互延迟。
在 WBench 表格中,EVOKE的 Video Quality、Setting 和 Physical 三组平均分分别为 82.79、83.76 和 72.06,均高于表中其他系统;Consistency 平均分为 86.87,与最高结果 86.86 基本相当。论文还称其在 WBench 达到 state of the art,并在 VBench-Long、VBench-2.0 上保持 competitive。不过,所给材料没有后两项的具体分数、评测协议或统计显著性,结论仍主要来自研究团队自己的论文。
作者还展示了七段连续两小时、持续接受相机控制的生成结果。它说明系统能够进行小时级运行演示,但不能替代对最长稳定时长和失败率的系统测量。
局限与未知
- “无尽”指单次调用的上下文和位置范围有界,不等于世界永不遗忘。状态库采用固定容量和淘汰机制,只保证保留范围内的回访一致性。
- 教师的长序列计算仍随长度线性增长;保持固定的是部署时学生每次调用的上下文,不能说整个训练与运行系统的总成本恒定。
- 现有证据全部来自同一篇论文。长期一致性失败率、状态库淘汰后的表现,以及完整交互延迟,材料均未披露。