Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
NEWS 约 4 分钟

大模型高分,可能赢在坏题

四套主流大模型“统考试卷”被查出坏题,部分题库约12%有问题,排行榜也该复核了。

IMAGE — r/LocalLLaMA 日榜

你参加一场考试,明明答对了,却因为标准答案写错而丢分;还有些题,本来就不止一个合理答案。这样的试卷拿来给学生排名,分数再精确也靠不住。大模型排行榜可能正面对同一种问题:模型得分不仅取决于能力,也取决于题目、答案键和评分规则是否可靠。

一位作者近期审计了 GPQA-Diamond、GPQA-Extended、MMLU-Pro 和 MMMU-Pro。所谓基准测试(benchmark),就是让不同模型做同一套固定任务,再用分数横向比较。作者报告称,这四套“统一试卷”里存在格式错误、答案键错误,以及多个答案都说得通的题目。其中,GPQA-Extended、MMLU-Pro 和 MMMU-Pro 各有约 12% 的题目被作者判定为“可以验证的问题题目”。不过,目前全部结果都来自同一作者的 Reddit 帖文及其 GitHub 项目,尚无外部团队复核。

排行榜先要有一张靠谱的卷子

这次工作做的是答案键审计:逐题检查题目是否成立、标准答案是否正确,以及是否存在多个合理答案。它关注的不是模型会不会考试,而是阅卷规则有没有把正确回答判成错误。

被审计的几套基准覆盖了不同能力。GPQA 以研究生或博士水平的生物学、物理学和化学问答为主;其中 Diamond 是按专家一致性、非专家难以作答等标准筛出的高质量、高难度子集。MMLU-Pro 侧重多学科文字问答。MMMU-Pro 则加入图像等多模态材料,用来衡量模型结合文字和视觉信息作答的能力。

作者最初注意到,顶尖模型在 GPQA-Diamond 上似乎长期停在约 92%—93%,于是开始检查 Diamond 和范围更大的 Extended,随后把审计扩展到 MMLU-Pro 与 MMMU-Pro。作者称,发现的问题包括题目格式不完整、标准答案有误,或者存在不止一个现实可接受的答案。

这里最需要谨慎的是“约 12%”这个数字。材料只明确把它用于 GPQA-Extended、MMLU-Pro 和 MMMU-Pro,并没有给出 GPQA-Diamond 的对应比例。因此,不能把结论写成“四个基准都有 12% 坏题”。“verifiably broken”也是作者自己的判定用语,还不是经过独立复核的行业共识。

分数上涨,不等于模型突然变强

作者还称,处理问题题目后,顶尖模型的成绩达到约 98%。但供稿没有说清具体是哪些模型、对应哪个基准、采用什么评分设置,也没有交代这一比较究竟只删除了题目,还是同时修正了答案。

这一区别很重要。删除较难或争议较大的题目,本身就可能抬高百分比。因此,从约 92%—93% 到约 98%,不能直接解释为模型能力提高。更准确的说法是:换用作者整理后的题集和评分方式,报告中的分数发生了明显变化。这反过来说明,排行榜不仅在测模型,也在测那张试卷是否干净。

为什么值得关注

主流基准常被压缩成一个醒目的百分数。人们据此判断哪个模型更强、一次升级是否有效。但如果一套题里有相当一部分无法稳定判分,那么模型之间几分的差距,可能小于试卷本身带来的误差。

作者为四个基准发布了 Clean 版本,即移除问题项后的版本;同时提供问题候选清单,让读者查看每道题为何被标记。项目还包含原始版与清理版的双重评分、lm-eval-harness tasks——一种用于运行模型评测的任务配置,以及 Hugging Face datasets——便于获取和使用的数据集版本。这些材料至少让后续复核有了明确入口,也让排行榜可以同时展示“原卷成绩”和“清理后成绩”。

局限与未知

  • 目前只有一个独立信源,且来自作者本人发布的帖文与项目;没有同行评审或外部团队复现信息,更稳妥的称呼是审计报告或项目。
  • 约 98% 的比较对象和评分设置表述含糊,不能据此断言模型真实能力提升。
  • GPQA-Diamond 的问题题目比例没有披露,约 12% 的结论不能外推到全部四套基准。

供稿材料 SOURCES — 1

← 返回 2026-07-30 · 开源板块