Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER HF 293 约 7 分钟

语言模型不再只猜下一个词

NCP让语言模型在逐词预测之外,也学习预判后续概念,试图改写最基础的预训练方式。

你看到“今天天气很”,大概会接一个“好”字。传统语言模型的基础训练也很像这样:反复猜下一小段文字是什么。但只盯着下一个词,就像写文章时只考虑下一笔,而不提前想这一段要表达什么。NCP-ArchPreview尝试给模型增加第二项任务:除了猜下一个词,还要预判后续一段文字大致属于什么概念。

这项工作触及语言模型最基础的训练范式。它没有放弃逐词生成,而是在其上叠加一层“概念级预判”。NCP团队在9月9日提交的技术报告中称,这种联合训练可以提高训练效率和下游任务表现。不过,目前所有实验结论都来自团队自己的报告,尚无独立信源交叉验证。

不只接词,还要预判这一段

下一Token预测(Next Token Prediction,NTP)是语言模型常用的训练目标。Token可以理解为模型处理文字时切分出的基本单位,可能是一个字、一个词或词的一部分。模型读到前文后预测下一个Token,再把正确答案用于纠正自己。重复许多次,它逐渐学会语言中的规律。

NCP-ArchPreview保留了这套机制,同时加入下一概念预测(Next Concept Prediction,NCP)。这里的“概念”不是人工写好的主题标签,而是模型从自身隐藏状态中整理出来的离散表示。隐藏状态可以理解为模型阅读文字时形成的内部数字记录;这些记录所在的潜在空间,则像一张由数字构成的概念地图,相近含义通常处在更接近的位置。

换句话说,传统目标问的是:“下一个Token是什么?”NCP增加的问题是:“接下来跨越多个Token的内容,大致会落在哪个概念上?”前者保证模型仍能逐词写出句子,后者试图迫使它同时关注更长一些的意义单位。

先把模糊含义编成号码

要预测概念,首先得把概念变成能够明确预测的标签。NCP-ArchPreview采用产品量化(product quantization):把一条较长的内部表示拆成几段,让每一段从有限的“编号词典”中选择最接近的一项,再把这些编号组合起来。

可以把它想成整理没有名称的颜色。模型内部原本只有连续变化的色彩,很难直接说某一种颜色究竟是哪一类。产品量化则把颜色的不同维度拆开,各自选择一个编号,最后用一组编号代表它。连续而模糊的内部表示由此变成离散概念,模型也就能把“预测未来概念”当成一项明确的训练任务。

报告称,这套概念词表直接来自模型自己的隐藏状态。随后,一个专用的Concept Module——负责概念预测的模块——学习预测未来概念。预测结果再反馈到Token层,用来指导接下来的文字生成。NTP和NCP并不是先后分开的两套训练,而是端到端联合进行:模型一边学习怎么接词,一边学习怎么预判后续内容的概念。

这一步的关键不只是增加了一个辅助标签。概念词表由模型自己的内部表示构建,因此不需要材料中未提及的外部人工概念体系。至于这些离散编号是否对应人能直接说出的“数学”“天气”或“因果关系”,报告摘要没有披露,不能把它们简单等同于人类概念。

两组数字最值得看

团队把NCP-ArchPreview扩展到89亿参数,并使用Dolma-3数据集中的5.73万亿个Token训练。报告将其称为发布时规模最大的潜在空间语言模型演示。不过,“最大”是团队自己的表述,其比较范围和判定口径在现有材料中没有展开。

最醒目的结果来自与OLMo-3-7B的比较。团队报告称,NCP-ArchPreview只消耗完整训练Token总量的51.3%,预训练损失就达到OLMo-3-7B最终的水平。预训练损失是衡量模型预测与正确答案差距的指标,通常越低越好。这个结果指向一种可能:加入概念级目标后,模型或许能更快学到训练目标要求的规律。

但51.3%不能直接翻译成“训练成本下降48.7%”。NCP增加了概念模块,处理每个Token时可能产生额外计算。报告还给出另一组对照:在只使用标准计算量85%的情况下,该模型的训练损失接近一个参数严格对齐的89亿参数基线模型。这里的“标准计算量”究竟按FLOPs、训练时间还是其他方式计算,现有材料没有说明;“接近”也没有明确阈值。

完成全部预训练后,团队报告其下游任务宏平均分比OLMo-3-7B高2.45分。宏平均是先分别计算各项任务成绩,再让每项任务以相同权重参与平均。其中,数学推理评测GSM8K提高5.99分。受控实验还显示,潜在空间架构和NCP训练目标分别带来了增益。不过材料没有提供各项消融实验的具体数值、方差或统计显著性,因此目前更适合把它视为支持该思路的内部证据,而不是已经确定的普遍结论。

概念层可能不只服务预训练

报告还展示了两个训练完成后的用途。其一是领域适配,也就是让通用模型更贴近某个特定领域。团队称,只更新一个1700万参数的VQ模块——负责把连续内部表示转成离散编号的量化模块——就能形成轻量级适配接口。相对于整个89亿参数模型,实际需要更新的部分很小。

其二与生成加速有关。团队把概念表示注入DFlash2 drafter,并报告平均接受长度提高4.17%。DFlash2 drafter的具体机制以及“平均接受长度”的完整计算方法,现有材料没有交代,因此只能确认这一接口和报告数字,不能进一步判断它在真实应用中能节省多少时间或成本。团队称额外开销可以忽略,但同样没有给出明确阈值。

为什么值得关注

这项工作的意义,不在于宣布下一Token预测已经过时。恰恰相反,NCP-ArchPreview仍然依靠NTP维持Token级自回归生成。它真正提出的问题是:语言模型是否应该同时在两个尺度上学习——底层负责把文字一个接一个写出来,上层负责预判跨越多个Token的内容方向。

如果后续研究能够复现这些结果,这条路线可能把“概念”从模型内部难以直接约束的表示,变成可训练、可反馈、也可在训练后复用的中间层。它既可能影响预训练效率,也可能为领域适配和生成加速提供接口。更重要的是,它把改进焦点放回了训练目标本身,而不是只扩大参数量或数据量。

局限与未知

  • 现有证据全部来自NCP团队的一篇技术报告。51.3%、85%、2.45分、5.99分和4.17%都需要结合完整实验设置、评测组成、方差和显著性继续核查。
  • 报告材料没有说明离散概念究竟学到了什么,也没有展示它们是否稳定、可解释,或能否跨数据与任务复用。
  • NCP增加了架构与计算步骤。Token效率、实际算力成本和端到端训练时间之间是什么关系,目前不能仅凭摘要中的数字判断。

供稿材料 SOURCES — 1

← 返回 2026-09-14 · 学术板块