Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.054 — 2026-08-27
PAPER HF 18 约 8 分钟

ReWorld:世界走远了仍记得

ReWorld让生成世界在你走远后仍记得原地,同时兼顾动作响应与持续生成。

你在一座由 AI 即时生成的房子里走动。离开客厅,穿过长廊,再沿原路返回——沙发还在原来的位置吗?许多系统能把眼前几秒画得连贯,却会在旧画面离开“视野”后悄悄改写房间。ReWorld 要解决的,正是这种“走出镜头后,世界是否仍然存在”的问题。

交互式世界模型会根据用户动作持续生成环境画面,像一场边操作、边现场绘制的游戏。它既要马上响应按键,又要记住很久以前见过的地方,还要不停生成。三件事放在一起,矛盾就出现了:即时控制只需参考最近的画面;长期记忆却要求模型回看遥远历史,而保存和读取全部历史会越来越昂贵。

ReWorld 的思路不是强迫同一套机制同时做好所有事,而是先让控制与记忆在不同“视野”下学习,再把历史压进一个有上限的记忆系统。以下效果与数字均来自论文作者的实验,尚无独立复现。

让不同的“眼睛”看不同距离

注意力是模型决定当前生成时该参考哪些历史内容的机制,注意力窗口则规定它能回看多远。短窗口省算力,却容易忘事;长窗口记得多,但成本会随历史增长。

ReWorld 在训练时使用 mixed per-head attention windows。一个注意力层有多组并行的“观察视角”,称为注意力头。论文让多数头只看最近三个 latent chunks——latent chunk 是模型内部一次处理的一小段压缩视频表示;少数头则查看完整历史。前者练习根据当前场景和指令迅速行动,后者学习从远处找回旧地点。

但固定分工会留下隐患:部署时,完整历史已经不在显存里,所有注意力头只能读取同一个压缩后的缓存。若某些头从小只负责“看远”,换了记忆条件就可能失灵。为此,ReWorld 使用 random head routing:每一步训练都更换负责全局观察的头。这样,每个头都轮流做近看与远看的工作,控制和记忆不会绑死在特定头上。这套做法不增加新的参数、损失函数或模块。

模型还同时接收两类相机信息。直接注入的动作信号告诉它“现在往哪里走”;MRoPE——一种把相机位姿写入注意力位置编码的方法——则帮助它按拍摄位置寻找旧画面。说白了,一个负责执行命令,一个负责认路。

消融实验显示,单独加入动作信号后,控制指标全面改善,但长程重访的 SSIM 从 0.3898 降至 0.3376。SSIM 衡量两幅画面的结构相似程度,越高越接近。加入窗口分工和随机路由后,控制表现基本保持,重访 SSIM 回升到 0.3752。这支持了论文的核心判断:控制与记忆若直接挤在一起学习,会互相干扰。

不保存整段旅程,只留下路标

训练时学会回忆,不代表推理时能无限保存历史。KV cache 是模型存放历史中间结果的“工作记忆”;如果视频一直生成,它也会持续膨胀。论文称,在 720p 下,不受限制的缓存会在真正进入长程测试前耗尽设备内存。

ReWorld 因此使用固定预算的 bounded KV cache,并在旁边维护 pose-indexed landmark bank,也就是按相机位姿索引的“地标库”。最近画面继续留在工作记忆里;较老的片段只有在相机已经移动足够远时,才以完整分辨率存成一个地标。地标库满后,系统淘汰空间位置最重复的成员,而不是把所有旧画面压缩得越来越模糊。

当用户接近旧地点时,系统按当前相机位姿取回最近的六个地标,与开头的锚点片段和近期画面共同填入固定缓存。它更像旅行者只带一张近期路线和几张关键地点照片,而不是背着沿途每一帧录像。

这种缓存是不连续的,而普通训练看到的历史通常完整且连续。ReWorld 又加入 random chunk dropping:训练时随机拿掉部分旧片段,让缺页的历史也成为模型熟悉的输入。这样,部署时拼接出来的稀疏记忆不再完全陌生。

记忆从哪里学来

长期空间一致性要求模型离开某地再回来时,布局和物体仍大致保持原样。可训练视频若只一路向前,模型很少看到“返回原地”的证据。

ReWorld 的数据引擎汇集八个来源,分为 Unreal Engine 渲染、真实世界视频和游戏视频三组。论文把各来源的相机运动对齐到统一的物理动作尺度,让同一个按键在不同数据里代表相近的移动距离。它还构造 palindrome trajectories,即先沿一条路线前进,再把后半程按原路倒放的回文轨迹,为重访训练提供明确样本。

生成速度方面,ReWorld 采用 distribution-matching distillation——让少步骤学生模型逼近多步骤教师模型输出分布的蒸馏方法——把采样压到四个去噪步骤。训练只改动 LoRA adapter;LoRA 是挂在原模型上的小型可训练适配层。关闭适配器时,同一 backbone 可运行高保真多步模式;开启后则进入四步交互模式。论文展示了 704×1280 输出,覆盖写实、游戏和风格化世界。

数字说明了什么

在由 40 张起始图像和 6 类轨迹组成的控制测试中,每种方法生成 240 段视频。ReWorld 与 SANA-WM、DreamX、HY-WorldPlay、Matrix-Game 3.0、LingBot-World 和 Yume-1.5 比较,整体旋转误差为 11.95°,是七种方法中最低;camera motion consistency 也最好。不过它并非每条轨迹都领先,旋转较重的弧线路径仍是各模型的难点。

在统一规格后计算的七项 VBench 视频质量指标上,ReWorld 平均分为 0.850,同样居首。但优势来自较均衡的表现,不是某一项遥遥领先。论文也提醒,动态程度要和重访成绩一起看:移动得少,本来就更容易保持画面一致。

更关键的是长程返回测试。相机先远离起点,再原路返回;早期画面就是埋在长视频里的“针”。在 64 秒、384 个 latent 的实验中,固定 12-chunk 缓存的 ReWorld 仍能重建起始视图。此时滑动窗口早已丢掉起点证据,而保存全部 KV 的方案会显存溢出。这是 ReWorld 最有说服力的展示:它没有把完整过去留在手边,却能在需要时找回与当前位置相关的旧世界。

为什么值得关注

ReWorld 的价值不只是一项分数。它把交互式生成的三个目标放进同一个设计:短窗口保障动作响应,长窗口负责学习检索,地标库把长期记忆压进有限预算,四步蒸馏再尝试把生成推向可交互速度。

这也换了一个观察世界模型的角度。画面逼真只是第一层。一个可探索的生成世界,还需要在用户没有注视时维持某种持续存在的内部地图。ReWorld 尚未证明模型真正“理解”了空间,但它把是否能原路返回、能否在有限缓存下认出旧地点,变成了可以直接测试的问题。

局限与未知

  • 所有结果都来自作者侧实验,尚无第三方复现。部分基线在长程测试中移动距离明显不同,而移动较短会让重访更容易,因此相似度不能脱离实际路径长度解读。
  • 论文使用“real-time”和“streaming”,但材料未给出 FPS、具体硬件、端到端延迟与总显存占用。四步采样说明计算步骤减少,不等于已在常见设备上普遍实现实时运行。
  • 固定 12-chunk KV cache 不代表总内存完全恒定。地标库还有主机内存容量、更新、检索和传输成本;这些代价需要更完整的工程数据才能判断。

供稿材料 SOURCES — 1

← 返回 2026-08-27 · 学术板块