让 AI 连续生成几分钟视频,难点不只是“画得像”,还要避免人物越走越变样,并把算力花在真正难生成的地方。现有方法常用滚动 KV 缓存——只保留最近画面的中间计算——控制显存,却可能把早先仍重要的人物、服装或场景线索一并丢掉;同时,每个片段接受相同次数的去噪修正,平稳镜头也照样耗算力。
Surprise Forcing 的思路是把预算留给“意外”。画面离开缓存时,系统比较它与外部记忆库已有内容的差异:重复信息少存,新姿态、新物体或场景变化更值得留下;生成新片段时,再只取与当前画面相关的旧记忆。去噪也不再一刀切:完成第一步后,系统用相邻帧特征的最大余弦距离——可理解为画面变化幅度——估计难度,并按近期片段的难度分位决定缩短还是保留完整去噪流程。
这套方法无需重新训练模型。作者称,它在 VBench、VBench-Long 和 VBench-2.0 测试中改善了长程一致性与画质,同时维持实时流式生成速度;不过现有材料未给出具体提升幅度。