像教人开车时拿事后录像当提示:老师知道前方马上要转弯,学生在当下却不知道。少步自回归视频生成也有类似问题。它一边像接龙般逐段生成画面,一边把扩散模型原本多轮去噪的过程压缩到少数几步;但训练用的教师常能看完整段视频,甚至未来的镜头控制。这样给出的指导,可能依赖学生实际生成时根本看不到的信息,形成隐蔽的因果错位。
作者提出 Context-Matched Distillation(CMD,意为“上下文匹配蒸馏”)。它改用因果教师——评价当前画面时,只读取此前已经出现的画面和控制指令,不能偷看未来。更关键的一步是 Prefix Scoring:教师不再参考一段另行构造的历史,而是读取学生真正生成当前目标时留下的前缀,也就是那段实际“来路”。训练早期,这些前缀往往不稳定;Prefix Corruption 会对其适度扰动,降低教师对偶然瑕疵的依赖,同时保留时间顺序和控制信号。
这项工作的价值不只在于加速,而在于让训练规则与上线时的信息边界一致。作者称,CMD 在长短视频测试中提升了自回归方法的综合表现,也明显降低了随时间变化的镜头姿态误差;不过供稿节选未给出具体数值。