Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.051 — 2026-08-24
PAPER H 10 约 1 分钟

蒸馏不只看答案,还看推理有没有进展

给蒸馏加一道“推理进度检查”,避免教师打压学生走得通的新路。

学生解题时,有一步虽然没照教师的思路写,却明显更接近答案;传统训练仍可能因为“写得不像”而惩罚它。论文瞄准的正是这个错位:On-policy distillation(学生先生成自己的解题过程,再由教师沿途指导)通常把贴近教师输出当作奖励,却未必看得出哪一步真的推动了解题。

作者提出 R2-OPD。它把推理轨迹切成若干段,通过从中间状态继续作答、比较解题成功概率的变化,估计每段的“推理进展”;同时按教师给出的蒸馏奖励给这些段排序。若两套排序冲突——例如进展更大的段反而受罚更重——系统就屏蔽最不一致段落的蒸馏奖励。为减小分段和采样噪声,方法还会合并进展方向一致的相邻段落。

关键在于,它没有用新指标取代教师,也没有把推理进展直接塞进训练目标,而只是拿它做一次可靠性检查:教师意见与解题进展一致时照常保留,不一致时少教一点。作者称该方法在推理任务上持续优于标准 OPD;具体适用边界仍以论文实验设置为限。


供稿材料 SOURCES — 1

← 返回 2026-08-24 · 学术板块