Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER H 4 · HF 7 约 7 分钟

世界模型也要有可寻址记忆

WorldTrace 给视频世界模型装上带目录的视觉记忆,让它走远后仍能认出旧场景。

你让 AI 在一座虚拟房子里走上一圈,再回到起点。它可能生成一个看起来合理的房间,却已经不是刚才那个房间:门换了位置,家具也变了。问题不只是 AI “忘了”,还可能是旧画面明明存着,它却找不到。

论文《Addressable Memory for Video World Models》研究的正是这件事。作者提出 WorldTrace,把不断增长的视觉缓存整理成一组位置固定、可以分别读取的记忆槽。它不要求重新训练模型,目标是让互动视频世界展开得更久之后,仍能维持场景一致性。以下方法解释和效果数字均来自作者论文,目前没有外部复现或独立评测。

存下来了,为什么还是读不到?

视频世界模型会根据已有画面和动作预测下一段画面,可以把它理解为一台能随操作继续生成的互动视频机器。它通常借助注意力——生成新内容时决定回看哪些旧信息——读取 KV Cache。KV Cache 是模型保存的中间表示,作用类似生成过程中的视觉草稿,免得每次都从头计算。

这份草稿会越积越长。直接保留全部历史,空间开销随视频长度增长;只保留最近一段,又会丢掉早期场景。于是,一个自然办法是把旧缓存压缩成固定数量的摘要。

论文指出,压缩本身还不够。许多视频模型使用 RoPE(旋转位置编码)标记画面的时间位置。它像给每帧附上一种随时间旋转的坐标,让模型知道先后关系。视频一旦超过训练时见过的长度,当前画面与旧画面之间的时间距离也会越界。按作者的解释,注意力机制面对陌生的距离坐标,就可能无法可靠读取那段记忆。

换句话说,旧档案仍在库房里,但目录编号已经超出管理员熟悉的范围。长期记忆首先是“能不能寻址”的问题,而不只是“有没有保存”的问题。

给旧记忆重新编目录

WorldTrace 把有限的缓存分成两部分:一部分原样保留最近画面,另一部分用若干 summary slot(摘要槽)存放更久以前的历史。关键一步是,每个摘要槽都获得一个独立的 virtual position(虚拟位置)。这些位置始终落在模型训练时见过的时间范围内,而且只由槽位次序决定,不随视频总长度继续向外漂移。

这相当于不再用档案产生于第几万秒作为索引,而是把它们重新放进模型熟悉的固定书架:第一格、第二格、第三格。每格编号不同,所以模型既认得这些位置,也能区分不同记忆。

但重新编号会遇到第二个问题。RoPE 已经按原时间位置旋转了每个 key。如果直接平均这些旋转后的表示,就像把朝向不同的箭头相加:一些方向会互相抵消,摘要反而丢失信号。WorldTrace 因此先把 key 还原到 canonical space(去掉原位置旋转后的统一表示空间),完成压缩,再按照新的虚拟位置重新旋转。value 不带 RoPE,论文的方法对它直接取均值。

可寻址的位置和正确的压缩方式缺一不可。前者保证模型找得到,后者保证找到的内容仍然有用。

两种记法,对付两种“记得”

WorldTrace 提供两种记忆写入方式。

WorldTrace-Field 面向 temporal coherence(时间连贯性,即相邻画面能否稳定延续)。它把离开近期窗口的历史按连续时间分组,在统一表示空间里求平均,再写入各个摘要槽。它保留的是过去的大致“场”,适合后续生成需要平滑参考整段历史的情况。作者还会在主机内存保留被移出缓存的 key,并随分组边界变化重新计算均值;论文称,因此 GPU 峰值内存可与滑动窗口基线相同。

WorldTrace-Landmark 面向 episodic recall(情景回忆,即能否找回某个具体场景)。它比较相邻帧统一表示的余弦距离,在距离突然升高时,把新画面视为场景入口。方法原样保存这些入口帧,而不是将它们平均掉。槽位满后,最旧的入口让位给最新入口。保存下来的 key 固定在统一表示空间,每次只针对当前虚拟位置重新旋转,以减少反复转换累积的数值误差。

两者的取舍很直白:Field 像连续写摘要,擅长维持整体连贯;Landmark 像给关键地点拍快照,更适合离开很久后认出原处。

绕一大圈,它还认得起点吗?

作者还发布了 LoopBench。这个基准让模型沿若干路点移动,经过一段绕行后返回旧地点,再比较返回画面与出发时对应视角的相似程度。它覆盖不同路点数量、生成长度、镜头方向和多次重访。

实验主要使用 MG2-1.3B,一个拥有 13 亿参数的自回归游戏世界模型;附录还测试了 LingBot-World。对照方法包括默认的 sliding-window cache(滑动窗口缓存,即不断丢弃最老内容),以及采用其他位置分配或压缩方式的方案。

据作者报告,WorldTrace-Field 在长时间生成中把 temporal consistency 提高了 15.5%;WorldTrace-Landmark 在 LoopBench 的 ABA 返回路线中把 episodic recall 提高了 19.5%。论文还称,Landmark 在 LoopBench 所有报告条件下都胜过滑动窗口,而长距离绕行和多个中间路点时优势最大。这里的 15.5% 和 19.5% 原文没有说清是百分点还是相对提升,不宜理解为适用于所有模型和场景的普遍增益。

为什么值得关注

这项工作的角度比“给模型更多缓存”更进一步。它把世界模型的长期一致性拆成两个问题:旧内容存什么,以及未来还能不能准确找到它。普通缓存更像按时间堆放录像;WorldTrace 试图把它变成带目录、可分别读写的视觉档案柜。

这个区别对互动世界尤其重要。连续生成的视频只要下一帧顺眼,短时间内未必容易露馅;可探索的世界却允许使用者离开、折返和重复访问。此时,“生成一个合理的房间”不够,模型必须生成“先前那个房间”。WorldTrace 展示了一条无需重新训练、直接改造现有缓存组织方式的路径。

局限与未知

  • 结果全部来自提出 WorldTrace 的同一团队,LoopBench 也是团队自建基准,存在方法与评测同源的问题;目前没有独立复现。
  • 论文面向采用 temporal RoPE、以固定 KV 缓存运行的自回归视频世界模型。现有材料没有给出可推广到哪些模型的完整边界,也没有量化所谓“延长视觉持久生成”的统一幅度。
  • Field 可能模糊具体场景细节;Landmark 则依赖场景转换检测是否选对、是否保住关键入口。面对自由移动和视角变化,如何在两种记忆之间自适应选择,仍是开放问题。

供稿材料 SOURCES — 1
01
Addressable Memory for Video World Models arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-13 · 学术板块