你可以把多人世界模型想成一场由 AI 实时转播的比赛。两名选手时,它还能同时照顾各个机位;人数一多,如果每个画面都要和其他画面反复核对,计算量很快就会失控。更麻烦的是,新选手中途加入,模型可能还得重新训练。论文提出的 Khora 换了一个思路:先维护一份共同的“现实总账”,再让每个机位按需读取。加人不再意味着重做整套系统。
这项工作的重点不是让单个画面更漂亮,而是让多智能体世界模型——预测多个行动者如何共同改变环境的模型——摆脱固定人数。下文数字和结论均来自论文自身的实验,尚无独立复现。
人一多,难点不只是多生成几段视频
多人模拟有两种扩张同时发生。
第一种是互动的组合爆炸。假设每个人只有两种选择,十个人已经有上千种联合情况。模型必须判断这些动作怎样共同改变环境。
第二种是视角扩张。每名智能体可能都要看到自己的画面,而且不同画面必须描述同一个世界。一个人看到物体被推走,另一个人不能还看到它留在原地。这叫跨视角一致性。
论文作者概括称,现有多智能体世界模型通常在训练和推理时绑定固定人数。有些方法还让各路视频在昂贵的生成器内部密集交换信息。人数增加后,需要协调的观察流也随之增加;另一些方法虽然保存共享记忆,生成接口仍按预先规定的视角槽位组织。于是,中途加人可能需要重新训练、调整结构,或提前安排好视角布局。
这里还要区分两个数量:环境里有多少活跃智能体,以及系统实际请求生成多少个视角。前者影响状态维护,后者直接决定要运行多少次画面生成。两者不总是相等。
先记世界,再按视角出图
Khora 的核心是 STBoard(Spatio-temporal Board,时空板)。它像一份共享世界状态,也就是所有参与者共同维护的“现实总账”。其中一部分保存相对稳定的场景记忆;另一部分是可动态增减的实体表,记录智能体的身份、位置、速度、朝向、占据区域和任务相关状态。
新智能体加入时,系统根据它的第一帧观察初始化实体状态,把新条目追加到表中。智能体离开时,则从活跃集合中移除。它们不是被塞进预先固定的“一号机位、二号机位”,因此人数变化不要求修改渲染器结构。
接下来,Khora先更新世界,再生成画面。它根据动作给每个智能体算出一个确定性的运动提议,例如前进或转动镜头;随后由学习得到的残差进行修正。残差可以理解为“动作指令之外的现实影响”,例如碰撞、地形带来的变化,以及其他智能体造成的干扰。更新后的结果写回 STBoard。
最后才轮到视觉渲染。系统把可能出现在目标镜头中的实体,按相机几何关系投影到画面坐标,并整理成固定尺寸的空间条件图。图中编码占据、深度、朝向和身份等信息,也会处理重叠与遮挡。神经渲染器——负责真正生成画面的模型——每次只处理一个目标视角,而且所有智能体共用同一个接口。
关键就在这里:Khora不要求各路视频在渲染器内部彼此“开会”。它们通过 STBoard 间接共享同一个世界。新增智能体会增加实体条目;新增查询视角会增加一次独立渲染,但不会改变渲染器本身。
它真的没有被人数拖垮吗?
论文在 1 至 80 个智能体的测量区间内报告,每个模拟步的总计算延迟从 107.16 毫秒升至 116.73 毫秒;单视角帧率从 37.33 FPS 降至 34.27 FPS。到 80 个智能体时,实体投影和栅格化占总推理延迟不到 8%。作者还称,单张 GPU 的峰值显存基本保持稳定,因为各视角复用同一个、与人数无关的渲染接口。
不过,这不等于生成 80 路画面几乎不要成本。论文把额外视角分配到更多 GPU 后,总吞吐量从单智能体的 37.3 view-fps 增至 80 个智能体时的 2741.3 view-fps。这个结果说明接口容易并行扩展,但也意味着硬件总量不能从讨论中消失。Khora近似线性扩张的是按查询视角执行的主要渲染成本,不是整个系统在任何规模下都保持常数开销。
共享状态是否真的有用,论文还做了一个对照:遮蔽其他智能体的动态状态,只保留目标智能体自身信息。完整 Khora 的跨视角动作一致性用户评分为 3.57,对照版本为 2.075;综合评分分别为 3.8917 和 3.07。以 8 视角视频为例,完整模型的 FVD 为 53.6148,对照版本为 104.9082。FVD衡量生成视频与真实视频在整体分布上的距离,越低越好。结果支持一个直观判断:先让各视角共享同一份世界状态,确实比让它们各自猜测更容易保持事件一致。
论文还展示了一次连续模拟:系统从 2 个智能体开始,中途增加到 4 个、再增加到 8 个,随后又让若干智能体离开。整个过程中,转移模型、STBoard接口和渲染器都没有更换或重新训练。新加入者从第一帧观察初始化,并在相关视角中出现。
为什么值得关注
Khora真正改变的是多人世界模型的组织方式。过去,系统容易被理解成“同时生成若干条互相协调的视频”;这篇论文则把它看成“维护一个持续存在的世界,再回答任意视角的查询”。前一种设计天然围绕固定视频流展开,后一种设计更接近人数可变的开放环境。
这也给“可扩展”划出更清楚的边界:世界规则和渲染接口不应随人数重做,但每个需要展示的视角仍要付出生成成本。Khora没有消除计算,而是把最昂贵部分从视角之间的密集互动,改成可以逐视角执行和并行分配的工作。
局限与未知
- Khora需要每个环境的粗略静态先验,用它建立全局坐标和可见性判断;静态场景记忆还要针对具体地图适配,因此尚不能零样本进入完全陌生的环境。
- 论文虽提供画质指标、用户研究和运行测量,但作者也承认整体评估仍偏展示性质。长时间滚动后的漂移、跨视角一致性,以及更完整的运行与内存表现,仍缺系统基准。
- “可扩展到任意人数”指接口不预设人数,不代表算力无限。每个请求视角仍需一次渲染,实体到视角的投影最坏成本也会随规模增长;论文的实测范围止于 80 个智能体。