你要给一锅汤分配固定总量的盐、酸和香料。多放一种,就必须少放另一种;真正好喝的组合,也未必是把“最好的”单味材料堆在一起。大语言模型的预训练数据也一样:在 Token——模型读取文本时使用的基本计量单位——总量固定时,网页、代码、论文等数据多一点,其他数据就要少一点。每试一次配方,都要重新训练模型,代价远高于试一锅汤。
Yicheng Mao 与 Hongru Du 的这篇论文,尝试把这个问题重新放回一套已有的统计学框架:混合实验。作者不只问“哪种配比预测效果好”,还问“有限的试验次数应该花在哪些配比上,才能得到更多信息”。以下结果均来自论文对 RegMix 公开数据的再分析及据此校准的模拟研究,尚无独立实验复现。
配数据,本来就是做配方实验
混合实验(mixture experiment)研究的是一类特殊配方:所有成分的比例非负,而且相加必须等于 100%。这与固定 Token 预算下的数据分配天然对应。论文把数据域视为配方成分,把各域的 Token 占比视为成分比例,把每次小模型训练视为一个实验点,再把验证损失视为配方产生的结果。
若有 个数据域,一份配方可写成 ,并满足:
所有可选配比由此落在一个概率单纯形上——可以把它理解成“全部合法配方组成的空间”。在这个空间里,不能像调节互不相关的旋钮那样单独增加某一项;每次增加都会挤占其他项。
论文分析的 RegMix 设置包含 17 个 Pile 数据域。原实验训练了 512 个代理模型,每个模型有 100 万个非嵌入参数,并使用 10 亿 Token。代理训练(proxy training)就是先拿小模型试配方,再用观察结果指导更大的模型,类似先用小锅试菜。它依赖一个关键前提:小模型上较好的配方,到较大规模时仍大致排在前面。
不只预测,还要拆开看“谁和谁合得来”
作者使用二阶 Scheffé 响应面模型。响应面方法(response surface methodology)是用少量实验拟合一张“配方—效果地图”,避免枚举全部组合;Scheffé 模型则专门适配比例总和固定的混合问题。二阶模型除了描述各数据域的加性贡献,还加入两两交互:某一类数据单看可能一般,与另一类搭配后却可能更有用。
完整二阶模型在 17 个数据域下会包含大量项。作者因此加入稀疏化约束,把较弱的系数压到零,留下较少、较容易检查的关系。经十折交叉验证选择约束强度后,模型保留了全部 17 个一阶项和 63 个两两交互项;其中51项为负、12项为正。由于响应是验证损失,负交互表示两类数据搭配后的拟合损失低于简单相加的预期,正交互则相反。
论文报告,最突出的负交互集中在 pile_cc——源自 Common Crawl 的网页文本——与 arxiv、pubmed_central、freelaw、github 等数据域之间。前四个幅度最大的交互也都涉及 pile_cc。值得注意的是,其中一些专业数据在加性部分并不占优,加入与 pile_cc 的搭配关系后才变得有利。
这并不等于“网页文本能增强所有数据”,也不能据此给出通用配方。它说明的是一个更有限、却重要的现象:在这套数据和目标下,数据域的价值具有关系性。“某类数据质量高不高”可能不是一个脱离配方就能回答的问题。
可解释性有没有牺牲预测能力?
作者用排序而非单纯的损失误差检验跨规模迁移,因为实际决策关心的是:小模型挑出的优先配方,换到大模型后是否仍靠前。
只考虑加性贡献的一阶 Scheffé 模型,在 1M、60M 和 1B 三个评估规模上的 Spearman 排名相关系数分别为 0.902、0.892 和 0.879。加入稀疏的二阶交互后,三个数字升至 0.937、0.939 和 0.975;成对排序准确率也分别由 0.867、0.859、0.864,提高到 0.894、0.896、0.937。
作为灵活机器学习预测器的 LightGBM,在 1M 和 60M 规模表现更好:Spearman 相关系数分别为 0.990 和 0.986。到 1B 规模,稀疏 Scheffé 模型的点估计为 0.975,高于 LightGBM 的 0.962;但该评估集只有 64 个配方,两者的 95% bootstrap——通过重复重采样估计不确定性——置信区间重叠。论文因此把结论收在“表现可比”,没有宣称明确胜出。
这项取舍正是方法的看点。LightGBM 可以隐式捕捉复杂关系,Scheffé 模型则把加性贡献和两两交互明确拆开。研究者不仅得到一份排序,还能检查排序背后的配方关系。
更关键的问题是:下一轮该试哪些配方
论文进一步提出模型稳健的 I-optimal design。I-optimal 是一种最优实验设计准则,目标是在整个候选配方区域内降低平均预测方差。所谓“模型稳健”,是设计实验点时同时照顾一阶模型与包含交互的二阶模型,因为试验开始前并不知道真实响应面究竟有多复杂。
作者构造出的实验点与 RegMix 的随机 Dirichlet 采样明显不同。随机设计把比例较连续地铺在单纯形中;最优设计则更集中在边界,许多比例取 0,并在约 0.5 和 1 附近形成支持点。这些位置有助于识别单个成分贡献和两两交互。
在以完整 RegMix 数据拟合出的稀疏 Scheffé 曲面为“真实答案”、再加入估计噪声的模拟中,作者为不同试验规模各重复了 1000 次。结果显示,模型稳健设计用大约 350 次代理训练,就能在 Spearman 相关和成对排序准确率上达到或超过原来的 512 次随机设计参考水平。换算下来,相当于移除约 25% 的原始代理运行后,仍恢复相关的配方排序。
这不是已经在真实预训练项目中节省了 25% 成本。它是按既有观察结果校准的模拟结论,也不表示删掉四分之一试验后最终模型效果毫无下降。但它指出了一个经常被忽略的决策变量:昂贵的不只是训练大模型,前期“小锅试菜”怎么选,也值得设计。
为什么值得关注
过去的数据配比工作常把重点放在预测器:收集一批小模型结果,再训练一个模型预测未知配方。这篇论文把视线向前移了一步。既然每个代理训练都是付费获得的信息,就不能只讨论如何分析结果,还应讨论哪些结果最值得购买。
这种改写也让“数据质量”从单项评分变成组合关系。同一数据域可能加性贡献较弱,却能通过互补改善整个配方。对实际决策者来说,这比寻找一份永久有效的数据排行榜更接近问题本身:预算固定,真正需要选择的是组合。
局限与未知
- 实证分析只基于 RegMix 的一套公开代理训练数据,涉及特定的 17 个 Pile 数据域。论文明确把其他语料分类、训练目标和场景能否复现结果留作开放问题。
- 节省约 25% 代理运行的结果来自模拟。模拟又以同一数据拟合出的稀疏二阶 Scheffé 曲面为生成机制,因此可能天然偏向这类模型;若真实响应包含更高阶交互、阈值效应或局部突变,二阶曲面可能不够。
- 代理方法仍依赖跨规模排序能够保持。1B 评估只有 64 个配方,不确定性明显更大;现有证据支持这套框架值得继续试验,还不足以把它视为普遍适用的最优预训练配方。