你和朋友同时站在一间屋里。你从门口看见沙发,朋友从窗边看见桌子。两个人视角不同,但屋里不该因此出现两套家具。现在的多人视频世界模型却容易犯这个错:它常把“世界里实际有什么”和“某个人眼中看见什么”混在一起生成。参与者一多,系统不但重复计算,同一件东西还可能在不同画面里位置不一。
MASS(Multiplayer World Models with Authoritative Shared State,多人权威共享状态世界模型)换了一个更接近网络游戏的思路:先维护唯一认可的世界,再为每个观察者单独画画面。论文由 Alaya Lab、Peking University 与 Institute of Science Tokyo 的研究者完成。以下效果和规模数据均来自作者论文,尚无第三方复现。
先决定世界发生了什么
MASS 的核心是“权威共享状态”(Authoritative Shared State)。多人游戏通常让服务器保存唯一版本:角色在哪里、物品是否被拿走、碰撞结果是什么,都以它为准。玩家设备只负责显示自己的视角。
论文把这套分工搬进学习式世界模型,并拆成两个部分。
第一个是 Logic Engine,可以理解为学习出来的世界裁判。系统先用 schema——一份声明实体种类、字段及合法取值的结构说明——把世界写成 typed state,也就是带明确类型的状态记录。例如在 Snake 中,每条蛇都有身体位置、朝向和存活状态,食物也有自己的位置记录。
每个时刻,Logic Engine 接收上一时刻的共享状态、所有玩家的联合动作,以及声明过的外部输入,再预测下一份状态。联合动作是把多人同一时刻的操作一起裁决,避免因处理顺序不同而产生两个结果。模型没有在运行时调用手写的游戏状态转移函数;移动、碰撞、成长、拾取和死亡等结果,都从记录下来的轨迹中学习。
这份预测状态也是系统唯一的循环记忆——模型每一步都把上一步结果接着往下推。它同时充当服务器与客户端的同步基准。换句话说,MASS 不让每个画面各自记住一份世界历史,而是让所有画面共同读取同一本账。
再从每扇窗往外看
第二个部分是 Rendering Engine,即渲染引擎。它不决定世界如何变化,只根据共享状态和指定相机生成画面。可以把整个设计想成:Logic Engine 维护房屋平面和物品账本,Rendering Engine 再分别画出每扇窗看见的景象。
论文中的渲染器先把相机可见范围投影成包含占用情况、实体归属、玩家身份和相机几何信息的局部表示,再由学习得到的 U-Net——一种常用于图像生成的神经网络——输出 RGB 画面。每个视图彼此独立生成,却都以同一份状态为依据。
这种拆分还有一个直接好处:世界只推进一次。观看相机增加时,新增的是状态分发与渲染工作,不必为每个视角重新模拟整个世界。论文所说的“任意指定相机”,应理解为在这套方法设定内按需请求相机视图,并不等于已经证明模型能泛化到无限视角或现实中的任意相机。
数字说明了什么
作者在匹配的多人 Snake 基准上,让各方法从相同初始世界出发,使用相同数据、相机轨迹与训练预算,连续预测 128 个时刻。MASS 的 Parser recovery 为 0.764。这个指标用固定解析器从生成画面中恢复游戏状态;最强的视频式基线 B-PV 为 0.128。也就是说,MASS 生成的画面不只是看起来接近,更容易还原出背后实际发生的状态。
感知误差 LPIPS——数值越低,生成画面与参考画面在视觉特征上越接近——方面,MASS 得到 0.098,优于 B-UN 的 0.123 和 MultiWorld 的 0.277。跨视图分歧 X-view 则为 0.000;作者据此报告,在该基准中,渲染器没有给同一共享状态引入可测得的视图冲突。
一个关键消融实验也支持这套解释。B-UN 保留其余流程,却用稠密联合状态取代带类型的实体记录。它的 LPIPS 仍有 0.123,看上去并不差,但 Parser recovery 降到 0。像素相似,不代表模型真的保存了一份可恢复、可追踪的世界。
作者还把同一套 Logic Engine 与 Rendering Engine 架构分别用于八款游戏,每款游戏使用自己的 schema、tokenizer(把状态转成模型可处理符号的编码器)、embedding 和模型权重。渲染重建的 PSNR——衡量像素误差的指标,通常越高越好——从 Tron 的 23.72 dB 到 Frogger 的 40.24 dB,八款中有五款超过 32 dB。
在规模实验里,MASS 推进了包含 1,024 个模拟玩家实体的预测世界,并递归运行 10,000 个 tick,也就是 10,000 次世界更新。这个结果说明共享状态架构可以做很长、很大的离散模拟;但论文正文没有在所给材料中披露足以把它称为“千人实时运行”的速度与实时性数据。
为什么这条路线值得看
世界模型走向多人交互后,难题不只是“画面能不能继续生成”,而是所有参与者是否生活在同一个因果世界里。MASS 的重要变化,是把一致性从事后协调问题改成架构前提:先产生唯一状态,再生成各自画面。
显式状态也让错误更容易定位。研究者可以直接检查实体是否持续存在、位置是否正确、结构是否合法,而不用先盯着视频猜问题出在世界演化还是画面生成。客户端短暂收不到服务器更新时,还能从最近的权威状态继续预测;论文实验中,本地玩家在最多八次缺失更新内位移误差仍为 0,但其他可见物体的一致度会随远端动作缺失而下降。
局限与未知
- 主要证据来自规则简单、状态离散的 Snake 匹配基准。结果不能直接外推到开放世界、写实视频或通用多人仿真;论文也把 3D 环境和更丰富的实体交互列为后续方向。
- 1,024 个玩家实体运行 10,000 步证明了递归规模,但材料未给出足够的硬件、速度、实时性、画面质量和失败率细节。该实验使用了 Institute of Science Tokyo 的 TSUBAME4.0 超级计算机,也不等于普通设备已经能承载同等规模。
- 所有结果均为作者自报,尚无独立复现。MASS 让参与者共享同一份预测现实,但“权威”只表示大家采用同一版本,并不保证这份状态本身预测正确。