Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
NEWS 约 1 分钟

LLM跑分一天内能漂2.8分

三万余次小时级测试显示,LLM跑分一天内可波动2.8分,单次成绩未必能说明版本优劣。

IMAGE — r/MachineLearning 日榜

同一个大模型,早上测和晚上测,成绩可能并不一样。LLM Benchmark——用固定任务和规则衡量大语言模型能力的测试——通常只给出某一时刻的快照;但生产 API 的后端会更新,模型生成本身也有随机性。于是,一次跑分领先,未必真代表模型更强。

AIStupidLevel 开发者 ionutvi 自述分析了 31,352 个小时级跑分,覆盖 49 个模型标识,以及编程、深度推理和工具调用等任务。每项任务重复五次再汇总,提示词、评分逻辑和 API 参数尽量保持一致;编程答案还会实际执行。结果显示,同一天内的分数波动为 2.8 分,不同日期之间则为 8.4 分,约是前者的三倍。

这项分析的实用提醒是:小时级涨跌更可能混有正常噪声,持续数天的变化才更值得警惕。作者因此用每日中位数和连续变化点检测来识别性能漂移。上述数据来自系统开发者本人披露,材料未提供独立复核结果。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 科技板块