Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.047 — 2026-08-20
PAPER HF 28 约 1 分钟

长上下文蒸馏,不再受分词器绑架

让长上下文教师跨分词器带学生,长推理能力迁移不再要求同门同派。

像两位老师用不同方式给句子断词,若要求每个词一一对应,经验就很难直接传下去。SimpleOPD 解决的正是这个问题:长上下文教师和短上下文学生即使分词器不同,也能进行在线策略蒸馏——让学生先按自己的方式作答,再由教师评价这条实际生成的推理轨迹。

它最巧的一步,是把双方的答案还原成同一段文字,只监督起止位置和文本内容都完全相同的 Token——模型处理文字的基本单位;其余无法可靠对应的位置不强行配对。论文还发现,直接蒸馏会让学生越写越长,频繁超出上下文窗口,也就是一次能处理的 Token 上限。作者因此加入约束,限制学生偏离初始策略,并避免教师反复压制“结束作答”。

据作者实验,Intern-S2-Preview 在数学证明测试 ProofBench 上从 34.0 升至 55.2,提高 21.2 分。这个结果说明,迁移长推理能力未必要求师生使用同一套分词方式;不过效果数字目前来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-08-20 · 学术板块