你可以把大模型榜单想成一次公开考试。后来发现,一些考生训练时可能见过原题。第一反应往往是:这场考试作废,排名也不能信了。但事情还有一层区别。如果每个考生都因为见题而多拿了差不多的分,成绩确实虚高,第一名却可能还是第一名。只有不同考生从泄题中得到的好处相差很大,名次才容易被改写。
Stanford University 的 Xingyao Xiao 与 City University of Macau 的 Yihong Cheng 在这项研究里,正面拆开了这两个经常被混为一谈的问题:测试集污染是否抬高模型的绝对分数,以及它是否改变模型之间的相对排名。论文的答案是,在作者检查的 47 个公开模型和四套评测中,前一种现象存在,后一种现象却很少出现。
这里所有效果数字与结论均来自这篇 2026 年 7 月提交的 arXiv 论文,尚无第三方复现或榜单运营方数据交叉印证。
见过原题,还是确实会做?
评测基准(benchmark)是一套固定题目和计分规则,用来比较模型的知识、推理等能力。ARC、GSM8K、HellaSwag 和 MMLU 都属于这类考试。模型答对多少,形成分数;不同模型按分数排列,就有了榜单。
问题在于,模型的训练材料非常庞杂。如果评测题目或相近答案混进训练数据,模型可能只是记住了答案,而不是真的掌握了所测能力。这叫测试集污染(benchmark contamination),就像考生在考试前见过原题。
论文换了一个观察角度:不要只问模型在原题上得了多少分,还要把题目换一种说法再测一次。等义改写保留题目要考的能力,只改变表达方式,类似给同一道题“换皮”。如果模型确实会做,换一种说法后,表现应该大致稳定;如果它主要认出了训练时见过的措辞,改写后就更可能掉分。
作者把这种稳定性称为“锚题不变性”(anchor-item invariance):原题与语义等价的改写题,像两把刻度相同的尺子,理论上应测到同一种能力。两者对某个模型产生了异常不同的结果,就可能暴露记忆原题带来的额外收益。论文称之为原题与改写题的“差异化表现”。
这一步的关键,是在同一道题内部做对照。所测能力尽量不变,变化的是模型是否能依赖熟悉措辞。作者据此试图区分记忆与能力,而不是看到高分就直接宣布存在污染。
先用“已知泄题量”校准尺子
一种污染检测方法是否可信,不能只在真实榜单上找可疑现象,因为真实模型到底见过多少测试题通常并不知道。作者因此另外使用了 74 个模型,按已知污染剂量进行微调。微调可以理解为在已有模型上继续训练;这里研究者知道向模型注入了多少测试集内容,因此能检查指标是否会随污染剂量变化。
按照论文报告,这套方法能够随注入剂量识别污染。测试集泄漏对应的校正效应为“+0.187 accuracy points”。原文摘要没有进一步澄清这里是准确率比例增加 0.187,还是通常中文所说的增加 0.187 个百分点,因此不宜自行换算。
作者还设置了负对照:模型只用合法的训练集训练,没有人为加入测试题。测得效应为 -0.012,方法没有把它判成污染。换句话说,这把尺子不只会在作者注入污染时作出反应,也没有把一个明确未注入测试集的模型误报为污染。
需要注意,74 个模型主要用于校准方法。它们不能和 47 个公开模型简单相加,然后说研究检查了 121 个自然分布的公开模型。真正用于讨论现实榜单影响的,是后者。
分数被抬高,不等于次序被打乱
完成校准后,作者比较了两张榜单。一张使用原始题目,另一张使用等义改写控制后的结果。两张榜单的排名相关系数为 0.997。排名相关系数衡量两组次序有多接近;这个数非常接近 1,说明在这批模型与评测中,整体排序几乎一致。
但 0.997 不能读成“分数有 99.7% 可信”,也不能证明每一对相邻模型都没有互换位置。它只说明两张榜单的整体排序高度相似。绝对分数仍可能因污染而偏高。
作者还检查了 188 个“模型—基准”组合,也就是 47 个公开模型分别参加四套评测。只有 3 个组合出现了被两种参考改写共同印证的差异化污染。这里的“两种参考”是同一项研究内部的双重对照,并不是两家独立机构各自复现了结果。
论文据此判断,这批公开模型受到的污染大体均匀:污染通常会抬高绝对成绩,却很少达到重排榜单所需的差异程度。真正容易扭曲名次的,是少数模型比其他模型额外受益很多的“差异化污染”。
这也解释了标题里看似矛盾的判断:榜单可以被污染,同时仍保留相当稳定的相对次序。就像一次考试普遍漏题,所有人的成绩都不再准确反映真实水平;但如果大家得到的帮助相近,排名未必随之崩塌。
为什么这个区分重要?
过去谈到测试集泄漏,人们常从“分数不可信”直接跳到“排行榜作废”。这篇论文提醒我们,中间缺了一步:污染对不同模型的影响是否足够不均匀。
这不是替污染开脱。绝对分数虚高仍会让人误判模型到底有多强,也可能破坏不同时间、不同评测之间的比较。研究只是把评测可信度拆成两个更精确的问题:模型得了多少分,以及模型之间谁更强。前者受损,不自动证明后者也同等受损。
这个框架还给出了更具体的榜单改进方向。作者发布了一套经过校准的 invariance audit 参考实现——也就是检查原题与等义改写题是否保持一致的审计方法,并建议榜单在常规排名之外,同时报告改写控制后的排名与置信区间。置信区间用于表示结果的不确定范围,可以帮助读者判断很小的名次差距究竟是否稳固。
如果这种报告方式得到验证,读者看到的就不再只是一个孤零零的分数和名次,而是还能知道:换一种题目表述后,排序是否保持稳定,以及观察到的差距有多大不确定性。
局限与未知
- 结论的适用范围是作者选择的 47 个公开模型、ARC、GSM8K、HellaSwag、MMLU 四套基准,以及论文构造的改写题和污染指标。它不能直接推广成“所有 LLM 榜单的污染都不会改变排名”。
- 论文目前是单一机构性信源,没有第三方复现。所谓两个参考版本共同印证,也仍是同一研究内部的一致性检查。
- 材料称参考实现已经发布,但未提供仓库链接或外部验证;改写题是否始终保持原题难度与所测能力、实现能否稳定复现,仍待进一步核查。
这项工作的价值,不是给榜单发一张“无罪证明”,而是让争论更准确。发现污染后,我们仍要追问:它让每个模型多得了多少分,又是否偏爱了其中某些模型。只有把这两个问题分开,才知道受损的究竟是成绩刻度,还是模型次序。