你手里只有一套高质量医学教材,却要训练一个越来越大的专用模型。读一遍,教材很快会被海量通用网页淹没;读十遍、二十遍,又可能只把原题背熟。到底重复多少遍才划算?论文《Scaling Domain Data Repetition in LLM Pretraining》研究的,正是这道现实的配比题。
预训练(pretraining)可以理解为让模型通读一座巨型图书馆,通过猜测上下文来学习语言和知识。Token 是模型读取文字时使用的小片段;训练 Token 预算,就是整个训练过程允许模型看多少片段。模型变大时,阅读量通常也要增加,否则新增的容量可能“吃不饱”。问题在于,高质量领域资料很难跟着同步增长。训练规模越大,医学、法律等专业材料在全部读物中的比例就越容易下降。
重复现有资料,是最直接的补救办法。但重复过多会带来过拟合(overfitting):模型像是背熟了练习册答案,却未必会做换了数字的新题。论文试图找出稀释与过度重复之间的收益边界。
需要先说明,当前供稿虽标为全文精读材料,实际提供的研究内容只有论文摘要,没有模型规模、数据集、具体重复次数或相关系数。下文的实验结论均来自这一篇论文,尚无独立信源复核。
模型变大,不等于应该少读旧资料
论文考察一种贴近实际扩展过程的设置:模型参数增加时,训练 Token 预算按比例增加,同时保持 tokens-per-parameter ratio(TPP)固定。TPP 指“每个参数平均配多少训练 Token”,可以粗略理解为模型容量与阅读量之间的配比。
在同一个领域内,作者发现一个不那么直觉的趋势:即使 TPP 不变,最优重复次数仍会随模型规模温和增加。
为什么这点值得注意?一种直觉是,同一批资料数量没变,模型越大,就越容易把它们学透,因此应该少重复。论文报告的结果却指向另一边:模型和总阅读量一起扩大后,领域资料也面临更强的稀释。适度增加重复,仍可能有收益。
这里的“最优”,只能按摘要理解为作者实验设置下表现最合适的重复次数。材料没有披露具体评价流程,也没有给出增加幅度。因此,“温和增加”不能改写成一条精确公式,更不能直接理解为模型每扩大多少倍,就该固定多读几遍。
决定重复次数的,未必是资料有多少
论文还比较了不同领域。结果显示,最优重复次数与一个领域最终的验证损失呈强负相关。验证损失可以理解为模型在未直接用于训练的材料上“答错多少”的指标;损失越低,说明它在这项检查中表现越好。作者观察到,最终验证损失较低的领域,通常能够从更多次重复中受益。
相比之下,一个领域拥有多少独特数据,与最优重复次数只有弱相关。
这改变了问题的问法。训练团队不能只看“我有多少份专业资料”,再按资料量机械决定重复次数。按照论文给出的方向,领域本身呈现出的学习难度或可学习程度——在这里由最终验证损失体现——可能更有参考价值。
不过,摘要没有给出相关系数、显著性或各领域的具体结果。“强负相关”和“弱相关”都是作者对实验现象的概括,不能进一步推成普适因果关系。验证损失较低与适合更多重复同时出现,也不等于前者必然造成后者。
先用小模型试水
这项工作的实用落点,是代理模型。代理模型就是规模较小、训练成本较低,用来替更大模型预先试验设置的模型。
根据作者从实验结果提出的推论:对于固定领域,如果小模型与目标大模型保持相同 TPP,那么在小模型上调出的重复次数,可以作为大模型选择重复次数的实践性估计。
这像是先用小锅试配方,再决定大锅里放多少原料。它不保证两口锅的最佳刻度完全一致,但若论文观察到的“最优重复次数只随规模温和增加”成立,小模型就可能提供一个比凭经验猜测更可靠的起点。训练团队因此不必为每个候选重复次数都直接运行昂贵的大模型实验。
为什么值得现在看
专用大模型面对一个无法靠扩大算力自动解决的约束:高质量领域语料不会随着参数量和训练预算同步增长。若只增加通用数据,领域材料会被稀释;若不断复读,又可能过拟合。
这篇论文的价值,不是给出一个适用于所有领域的固定次数,而是提出三条判断线索:模型扩大时,合适的重复次数可能略有上升;跨领域选择时,最终验证损失可能比独特数据量更有提示作用;在固定领域、相同 TPP 的前提下,小模型试验可能帮助估计大模型设置。
说白了,它把“领域资料不够就多读几遍”这句经验判断,往可测量、可试验的训练决策推进了一步。
局限与未知
- 供稿未披露模型规模、TPP、数据集、最优重复次数、过拟合阈值及统计指标,无法判断趋势的实际幅度和适用范围。
- 小模型估计大模型设置,是作者基于实验提出的实践性推论,前提是固定领域且 TPP 相同,并非经过独立团队验证的保证。
- 材料显示论文于 2026 年 8 月 14 日提交,但当前只有聚合页面内容,正式发布状态及论文细节仍待原论文核对。