Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.044 — 2026-08-17
PAPER H 10 · HF 13 约 1 分钟

视频蒸馏也要对齐真实上下文

让教师只看学生当时看得到的内容,纠正少步视频蒸馏中的“偷看未来”偏差。

像教人开车时拿事后录像当提示:老师知道前方马上要转弯,学生在当下却不知道。少步自回归视频生成也有类似问题。它一边像接龙般逐段生成画面,一边把扩散模型原本多轮去噪的过程压缩到少数几步;但训练用的教师常能看完整段视频,甚至未来的镜头控制。这样给出的指导,可能依赖学生实际生成时根本看不到的信息,形成隐蔽的因果错位。

作者提出 Context-Matched Distillation(CMD,意为“上下文匹配蒸馏”)。它改用因果教师——评价当前画面时,只读取此前已经出现的画面和控制指令,不能偷看未来。更关键的一步是 Prefix Scoring:教师不再参考一段另行构造的历史,而是读取学生真正生成当前目标时留下的前缀,也就是那段实际“来路”。训练早期,这些前缀往往不稳定;Prefix Corruption 会对其适度扰动,降低教师对偶然瑕疵的依赖,同时保留时间顺序和控制信号。

这项工作的价值不只在于加速,而在于让训练规则与上线时的信息边界一致。作者称,CMD 在长短视频测试中提升了自回归方法的综合表现,也明显降低了随时间变化的镜头姿态误差;不过供稿节选未给出具体数值。


供稿材料 SOURCES — 1

← 返回 2026-08-17 · 学术板块