你让 AI 生成一段长视频:一个人放下红色背包,走出镜头,半分钟后回来。常见结果是,人还像那个人,背包却变了颜色;或者为了避免遗忘,模型死守开头,背景和视角迟迟不肯变化。问题已经不只是“记忆够不够长”,而是有限的记忆该怎样使用。
同期出现的 Ring Forcing、TetherMem 和 RECAP-Forcing,恰好从三个方向回答这个问题:训练模型主动翻查远处历史;根据当前查询决定查哪类历史;按外观是否首次出现来保存历史。三者并非一条统一路线,却共同说明,长视频生成的竞争焦点正从扩大窗口转向选择性记忆。下文的效果和排名均来自三个作者团队的论文自报,尚无外部复现。
记得多,不等于记得对
自回归视频生成像接龙:模型一段接一段往后生成,每段参考此前内容。视频越长,历史越多,它越难兼顾两件事。一是让场景继续发展,二是保持人物和物体的身份。
这里的“物体恒存”(Object Permanence),指人物或物体暂时离开镜头后,再出现时仍能保持原来的外观和身份。模型通常借助 KV Cache——为已经处理过的画面留下的中间笔记——查阅历史。但笔记会不断膨胀,不可能全部精读。
粗暴保留更多历史也会带来另一种失败:模型把旧背景、旧视角和旧场景结构当成不能改变的模板。于是人物还能活动,世界却像被钉在原地。反过来,如果只保留最近画面,早先出现、后来消失的身份线索又可能被清掉。
Ring Forcing:让模型练习“翻旧账”
Ring Forcing 认为,模型即使看得到很远的历史,也未必学会认真使用它。普通训练视频大多沿时间向前展开,短窗口里很少反复出现“离开很久又回来”的对象。模型因此更擅长顺着眼前画面往下接,而不是从远处历史找关键证据。
它的核心训练设计很直观:把一段视频与其倒放版本接成环,再把当前要生成的目标片段藏进较远的历史。要降低训练误差,模型就不能只看最近几帧,必须从远处把“答案”找回来。
团队还随机裁掉历史开头,避免模型利用与目标相邻的画面走捷径;并在一部分训练样本中完全移除环形历史。后一步是为了平衡两种能力:有明确旧证据时严格还原,没有答案可抄时仍能自然续写,而不是把生成变成机械复刻。
看得远仍然很贵。Ring Forcing 因此压缩历史,并利用扩散生成不同阶段的分工:高噪声阶段更关注整体结构和运动,使用时间较密、空间较粗的历史;低噪声阶段负责纹理和边缘,读取时间较稀、细节较多的历史。团队称,这种 timestep composition(按扩散时间步组合记忆)在固定序列长度下,把有效历史扩展到分钟级,并覆盖完整历史。
Sparse RoPE 则负责给压缩后的笔记标位置。RoPE 是一种位置编码,让模型知道内容在时间和空间中的相对位置。Ring Forcing 不把压缩片段简单编号,而是映射回原始时空坐标,帮助模型理解这条线索究竟来自多久以前、画面的哪个区域。
论文用 1 万条 10 至 240 秒的单镜头视频训练模型,并设计了 64 个“出现—消失—再出现”测试案例,消失时长从 0 到 60 秒。另一组 64 个提示词用于生成 60 秒视频。与 LongLive、LongCat、FramePack 相比,Ring Forcing 的人工总体质量评分为 4.22,略高于 4.19、4.04 和 2.25;21 名参与者参与了盲测。它在自动指标中也取得较好的美学、动态和一致性结果,但并非每项都领先,例如运动平滑度略低于几项长视频基线。
消融实验更能说明各部件的作用。在相同设置下,Sparse RoPE 相比普通 RoPE,把历史重建的 PSNR 从 19.05 提高到 24.22、SSIM 从 0.58 提高到 0.71,并把越低越好的 LPIPS 从 0.27 降至 0.13。不过这些结果仍来自作者自建设置。
TetherMem:人物和场景,不该查同一本账
TetherMem 处理的是另一种问题。现有方法往往让所有查询以相似方式访问历史。“查询”可以理解为模型生成当前区域时提出的问题:这个人长什么样,或者这个场景接下来该怎样变化。
TetherMem 把它们分开。主体查询继续读取承载身份的历史,以维持人物可识别性;场景查询则减少对主体历史和陈旧背景的依赖,让背景、视角和场景状态能够往前发展。它还根据画面区域与记忆年龄调节访问强度,相当于让不同问题走不同的资料检索通道。
它不需要重新训练,而是作为 query-aware memory router(查询感知的记忆路由器)接在冻结的视频生成器上。论文报告,在 10 名标注者完成的 2,400 次盲测成对判断中,TetherMem 在八种流式长视频基线里取得最高 estimated expected preference:总体质量为 0.780,场景进展为 0.769。这里的数字是估计期望偏好,不是胜率;2,400 是判断次数,也不是受试者人数。结论限定于完整的 30 秒视频,不能与 Ring Forcing 的分钟级主张直接比较。
RECAP-Forcing:按“第一次出现”存档
RECAP-Forcing 进一步改变了记忆的整理方式。它不问“这帧离现在有多近”,而问“这里有没有第一次出现的外观”。新人物进入、遮挡区域重新显露、新场景首次出现时,对应的 KV Cache 会被保留下来。
这像给不断扩充的角色与场景建立首次亮相档案。最近的画面未必重要,较早但记录了关键外观的画面却可能在很久以后派上用场。
它由两部分组成。视频开头,attention sink(让后续内容持续关注的一组初始记忆)保存初始场景;随后,基于 optical flow(估计画面中像素如何移动的方法)的 novelty bank 检测并保存新显露内容。整个方法不增加可学习参数,也不需要额外训练。
作者提出,记忆规模应随新增内容量增长,而不是随视频时长增长。这目前更适合作为设计原则:摘要没有给出严格的复杂度证明或实测增长曲线。论文还称该方法在多个强基线上持续改善视觉质量和语义忠实度,但没有披露数据集、对照名单、具体增益或显著性检验。
真正的变化,是开始讨论“忘掉什么”
三项工作最值得关注之处,不是又把窗口拉长了一截,而是把“记忆”拆成了不同问题。Ring Forcing关心模型是否会从远处历史准确取回信息;TetherMem关心谁在查询,以及主体和场景是否应该读取同样的过去;RECAP-Forcing关心什么内容值得留下。
这也意味着它们不能简单合并成一句“保留更多关键帧”。Ring Forcing强调全历史感受野和远程检索,TetherMem主动限制某些场景查询对旧历史的依赖,RECAP-Forcing则用外观新颖性取代时间新近性。它们给出的不是同一个答案,而是一张逐渐清晰的问题清单:生成更长的视频之前,模型先要学会有目的地记忆,也要有目的地遗忘。
局限与未知
- 三项工作的具体优势都来自论文作者自报,尚缺第三方复现与统一评测。
- TetherMem 的人工评测只有 10 名标注者;Ring Forcing 的人工评测有 21 名参与者,且测试基准由团队自行构建。
- RECAP-Forcing 摘要没有提供量化结果;Ring Forcing 虽披露了更多实验细节,但“显著优于”同类方法的完整统计依据仍需结合公开代码和复现实验判断。