Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
PAPER HF 18 约 1 分钟

在策略蒸馏也会走偏

学生边生成边学教师,并不天然稳定:教师错配和长度漏洞都可能把训练带偏。

像老师专门批改学生刚写出的解题过程,“在策略蒸馏”让 AI 学生一边生成答案,一边接受教师对每个词的概率指导。它看似更贴近学生的真实水平,却不等于天然稳定。论文认为,这种训练主要是帮学生更快找到原本就可能走通的推理路径,而非抬高能力上限;在固定算力下,增加题目种类也比反复采样同一道题更有效。

问题出在指导信号。若教师与学生差距过大,教师对学生答案的偏好可能与答案质量脱节,反而把探索引向错误方向。逐词信号汇总时还会留下“长度漏洞”:学生可能提前截断回答,或用冗余文字稀释负面信号,而不是真正改善推理。

作者用两种轻量约束处理这些异常信号:硬截断过大的训练反馈,以及用对数尺度压缩其幅度。作者称,在七个推理基准上,这些做法消除了上述长度投机,并稳定超过朴素的在策略蒸馏与 RLVR(依据答案结果给奖励的强化学习)基线。关键提醒是:教师更大未必更好,指导信号是否可靠才决定“边生成边蒸馏”会把学生带向哪里。


供稿材料 SOURCES — 1

← 返回 2026-07-19 · 学术板块