Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.055 — 2026-08-28
PAPER H 8 约 6 分钟

模型榜单差一点,算赢了吗

六个模型同答一套题,微小分差能否算赢,要把配对、题目聚类和多重比较一起算。

模型榜单差一点,算赢了吗

六个学生做同一张试卷,第一名比第二名多对几题。你会马上断定第一名更强吗?未必。也许差距只是偶然,也许几道题本来就很相似,还可能是你把所有人两两比较后,恰好挑中了一个看起来明显的差距。模型榜单面对的是同一个问题:分数排出了先后,不等于这些差距都足以支持“谁胜过谁”。

Juan Francisco Mandujano Reyes 于 2026 年 8 月 23 日发布的单作者 arXiv 预印本《Statistical Methods for Multiple Language Model Comparison on a Shared Evaluation》,试图把这件事放进一套统一的统计框架。它同时处理三层关系:模型回答的是同一批题;部分题目可能属于相关的学科簇;一次评测往往要比较不止两个模型。本文的数字与结论均来自这篇尚未见同行评审信息的论文及作者提供的分析。

同一张卷子,不能当成六张卷子

先看“配对比较”。如果两个模型回答同一道题,这两个结果天然成对。题目难时,两者可能一起答错;题目容易时,又可能一起答对。比较每道题上两者的得分差,可以先抵消一部分题目难度带来的波动。反过来,如果把两组答案当成来自互不相关的题集,就丢掉了这层信息。

题目之间也未必独立。同一学科、同一材料衍生的题,可能一起难或一起易。这叫“题目聚类相关”。把十道高度相似的题当成十份全新的证据,容易高估结论的确定程度。

还有第三个麻烦:多重比较。六个模型可以组成 15 组两两比较。即使模型之间本无稳定差异,试的组合越多,也越容易偶然撞见一个“显著”结果。论文指出,如果比较四个模型产生的六组配对都沿用普通显著性门槛,那么在各组实际没有差异时,至少出现一次假阳性结论的概率会超过 25%。

先问“整体有差异吗”

论文提出的核心办法,是用一个随机效应模型统一记账。这里的“固定效应”指研究真正关心的模型差异;“随机效应”则吸收具体题目以及题目簇带来的波动。说白了,它不只记录谁的平均分高,还估计这段领先可能混入了多少题目运气。

在题目完整配对、设计平衡时,这套模型可以用重复测量 ANOVA——一种先检验多组总体是否存在差异的方法——来拟合。流程分两步:先做一次总体检验,回答“这些模型是否整体上一样”;总体检验通过后,再进行经过多重比较校正的两两比较。平衡且没有聚类的设计可用 Tukey 检验;存在题目聚类或各模型作答数量不齐时,论文建议使用线性混合模型,再对估计边际均值做明确的多重性校正。Holm 或 Bonferroni 校正更保守,但能提供明确的错误率控制。

这套框架也连接了新旧方法。当只有两个模型,即 K=2 时,用经典 ANOVA 拟合,可以复现已有的配对估计;在特定的簇内相关假设下,混合模型还能对应已有的聚类估计。它的主要扩展,是让同一逻辑适用于任意数量的模型,以及题量不平衡、题目成簇的评测。

六个模型,十五场“对决”

作者用六个开放可用的模型做了实例分析。它们共同回答了从 MMLU-Pro 中按学科分层抽取的 1,497 道题,覆盖 14 个学科簇。这里的 1,497 道题只是六个模型共享作答的分析子集,不是完整 MMLU-Pro 的规模。

原始准确率从 23.8% 到 29.1%:Mistral-7B-v0.1 最高,为 29.1%;Mistral-7B-Instruct-v0.1 最低,为 23.8%。最高与最低相差 5.3 个百分点,但相邻模型常只差一两个百分点,正适合检验“榜单上的一点领先到底稳不稳”。

未经多重比较校正时,无论采用普通独立检验还是利用同题配对的检验,15 组比较中都有 5 组达到作者采用的显著标准。校正后,只剩 3 组。换句话说,配对处理在这批数据里几乎没有改变哪些比较过关;真正改变结论的是多重比较校正。

其中,未经校正的配对检验认为 Mistral-7B-v0.1 胜过 Qwen1.5-7B-Chat,也认为 Yi-6B-Chat 胜过 Mistral-7B-Instruct-v0.1。但经过 Bonferroni 或 Holm 校正,这两项都不再成立。不是说两边一定没有差异,而是这份数据不足以把差距与多次比较产生的偶然波动可靠地区分开。

配对信息仍然有价值。作者报告,正确按题目配对的重复测量 ANOVA,比忽略题目身份的普通单因素 ANOVA 得到更强的总体差异证据。混合效应分析还发现,学科聚类解释了真实但相对有限的一部分剩余波动。至少在这个实例中,不能预先断言哪一层修正最关键;应该让数据说明题目配对、学科聚类和比较次数各自影响了多少。

为什么值得关注

榜单通常给出一个整齐的排序,统计结论却更像一张带边界的地图。第一名可以是原始均分最高者,但“均分最高”“差异难以用噪声解释”“差异足够影响实际选择”是三件不同的事。

这篇工作的价值,不是发明另一种排行榜,而是要求每一条“模型 A 胜过模型 B”的说法交代证据结构:它们是否做了同一批题,题目是否成簇,一共尝试了多少组比较,校正后结论是否还在。对消融实验和超参数搜索也一样——同时试很多版本,再只报告最亮眼的一组,容易把偶然领先写成方法进步。

局限与未知

  • 这是一篇单作者 arXiv 预印本。模拟与真实数据验证都由作者完成,尚无独立信源交叉印证,不能写成已经确立的学界共识。
  • 实例只分析六个模型在 1,497 道共享 MMLU-Pro 题目上的表现。结论是否适用于其他模型、题集或评测结构,材料没有给出证据。
  • 统计显著不等于差距具有实际价值,也不等于某个模型在所有任务上整体更优。因此,榜单“差一点”既不能直接算赢,也不能直接判作没赢;它首先要求一套与评测设计相匹配的比较方法。

供稿材料 SOURCES — 1

← 返回 2026-08-28 · 数据板块