Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.034 — 2026-08-07
PAPER HF 97 约 7 分钟

蒸馏中的老师也会制造幻觉

老师拿着答案册教,学生却要闭卷答。DAPD试着堵住蒸馏中的“特权错觉”。

你让学生看着答案册学习解题。老师每一步都讲得又快又准,学生也模仿得很好。可到了闭卷考试,学生仍会像手里有答案一样,跳过关键推导,甚至笃定地写下没有依据的结论。DAPD 研究的正是 AI 训练里的这个问题:教师提示可以增强指导,却也可能让学生学会一种离开提示就无法复现的行为。

论文把它称为 privilege illusion(特权错觉)。标题里的“老师制造幻觉”是便于理解的专题化说法,并不等同于通常所说的事实性 hallucination。它更具体:学生依赖训练时才有的额外线索,部署后拿不到线索,却仍表现得像线索存在,结果反而变差。本文的结论和数字均来自 Jianyu Wu、Yizhou Wang、Encheng Su、Chen Tang、Shixiang Tang 的论文,尚无独立信源交叉验证。

问题不只在老师教错了

这里采用的是 on-policy self-distillation(在策略自蒸馏,OPSD)。普通的策略蒸馏,是让学生学习教师在不同情境下会怎样输出;在策略蒸馏则先让学生按当前能力写出回答,再由教师针对这份“现场草稿”逐词指导。它贴近学生真正会遇到的状态,指导也比只看最终对错更细。

为了让教师更强,训练时通常会给它 privileged information(特权信息),例如完整参考解答或工具输出。论文采用的设置很直白:学生只看到题目,教师还会看到一份插入提示中的完整参考解答。问题在于,部署时学生仍然只有题目。

作者认为,根因不是教师水平不够,而是 information asymmetry(信息不对称):老师拿着答案册示范,学生却要在没有答案册的条件下复现。教师给出的变化里,一部分是学生能从题目自行推出来的有效指导;另一部分只有看过参考答案才成立。原始 OPSD 把两部分一起教给学生。论文称这种混合更新为 Entangled Distillation(纠缠蒸馏)

作者设计了一个行为探针,统计模型在推导不足时直接声称答案的“错误断言”。在五种 Qwen3 规模上,随着 OPSD 训练推进,这类断言从每一万次生成 13 次升至 37 次;推理平均分 Avg@12 同时从 59.56 降至 53.24。这里的 Avg@12,是每道题生成 12 份答案后计算的平均正确表现。

更关键的对照是:作者没有换掉特权教师,只让被指导的一侧也看到与自身输出对应的完整内容,使双方掌握的信息大致匹配。相较 OPSD,这一改动让训练后期的错误断言减少 45%,Avg@12 提高 6.22 分。它支持了论文的核心判断:麻烦首先来自信息条件不一致,而不只是教师答案是否正确。

给开卷和闭卷各设一枚锚

作者提出 Dual-Anchored Policy Distillation(双锚定策略蒸馏,DAPD)。关键不是把参考答案删掉,而是在教师与学生之间增加一个 Self distribution(自条件分布):模型预测某份解答时,也以这份完整解答作为条件。它像一座中间桥。一头连接能看参考答案的教师,另一头连接部署时只能看题目的学生。

第一层叫 Dual-Path Anchoring(双路径锚定,DPA)。它同时安排两条路径:一条对齐双方都没有特权信息时的行为,确保学生闭卷时仍能走通;另一条在双方都得到完整解答的条件下对齐,保留参考答案能提供的正确性指导。说白了,不再让开卷老师直接要求闭卷学生复制动作,而是分别比较“都开卷”和“都闭卷”时应该怎样做。

其中,Inference Anchor(推理锚)负责把桥接分布拉回没有额外信息的推理状态;Privileged Anchor(特权锚)则在信息匹配的开卷条件下对齐教师与桥接分布。DPA 没有完全移除原始 OPSD,而是在其周围补上这些锚点,尽量把有用指导留下,同时阻止依赖答案册的行为直接灌进学生。

第二层叫 Dual-Source Anchoring(双来源锚定,DSA)。参考解答通常更可靠,却可能离学生当前能力太远;学生自己生成的 rollout——也就是训练时实际写出的完整回答——更容易复现,却可能出错。DSA 因此让指导双向流动:既让参考解答指导 rollout,也把 rollout 中学生已经能够做到的推理拿来指导参考侧。消融实验中,两条信息路径都加入后,参考指导和 rollout 指导分别达到 63.89 与 65.09;再结合两种来源,结果升至 65.28,高于任一来源单独使用。

两分提升,重要的是从哪里来

在六个评测上,Qwen3-4B 的 DAPD 平均得分为 57.34,比 OPSD 的 55.34 高 2.00 分。六项覆盖数学推理、代码生成、函数调用和指令遵循。DAPD 相比会过滤特权信号的 Purified OPSD 高 1.09 分,相比动态路由指导的 DOPD 高 3.85 分。作者据此主张,与其只筛选教师信号,不如先修正教师与学生的信息条件。

规模实验也值得看。OPSD 相对原始模型的增益从 1.7B 参数规模的 5.19 分,降到 4B 的 1.39 分;从 8B 到 32B,最高只剩 0.28 分。DAPD 在 8B、14B 和 32B 上仍分别比各自原始模型高 2.41、2.13 和 3.06 分,并持续优于 OPSD。论文给出的解释是:模型越强,自己的 rollout 越可能包含有用推理;若教师借助参考答案跳过这些步骤,蒸馏反而会抹掉学生可复现的能力。

这也接上了本刊 2026 年 7 月 19 日对 A1209 的报道:策略蒸馏会因教师错配和长度漏洞走偏,指导是否可靠比教师大小更关键。DAPD 把问题再推进一步——即使指导内容正确,只要教师和学生看到的材料不同,正确指导也可能以错误方式进入学生。

局限与未知

  • 论文的标题数字来自相同随机种子的配对实验,但未报告方差或统计显著性;“显著缓解”等措辞目前仍是作者结论。
  • DAPD 训练时要计算多个锚定分布,计算成本更高,不过论文称它不增加推理成本;不同规模或模型架构还可能需要重新调权重。
  • 论文还尝试用两个独立 rollout 代替人工参考,并用验证器挑选正确候选;这种方向能减少对参考答案的依赖,但开放式任务未必有可用的自动正确性信号。

供稿材料 SOURCES — 1
01
DAPD: Dual-Anchored Policy Distillation arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-07 · 学术板块