Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER H 5 约 1 分钟

字节模型蒸馏撞上Token天花板

字节级学生起步慢,却随算力增长越跑越快,可能突破Token模型的平台期。

让小模型跟着大模型“老师”学,通常要求师生都用同一种文字切分方式。问题是,常见的Token——分词器切出的字词片段——虽然读得快,能力却可能较早碰到平台。研究团队于是改用更底层的字节作为学生的文字单位,并比较两类学生在数据和算力增加时的成长曲线。

难点在于,老师按Token给出的Logit——选择下一个输出前对各候选项的原始评分——不能直接交给字节模型。团队提出End-Of-Token方法,用一个“Token结束”标记对齐两套评分,并在单次前向计算中完整保留老师的分布。覆盖问答、生成和翻译的八项基准显示:Token-1B在低算力阶段领先,但较快进入平台;字节模型起步较弱,却继续随算力改善。作者根据缩放规律外推,蒸馏后的End-Of-Token-1B平均下游表现最终可比Token-1B高最多4%,并能用六分之一训练数据追平后者。这个优势仍是模型外推预测,而非已训练到极限后的实测结果。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块