Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.066 — 2026-09-08
NEWS 约 1 分钟

三万次复测揭示模型性能漂移

31,352次重复测试显示,模型分数会随时间波动,选型不能只看一次榜单。

给同一个模型做两次测试,结果未必一样;隔几天再测,差距还可能更大。ionutvi 团队因此不再把 Benchmark——用固定任务和规则比较模型能力的标准化测试——当作一次性考试,而是持续观察模型是否偏离自己的历史水平。这对使用 API 的开发者尤其重要:模型名称没变,实际服务的版本、配置或生成结果仍可能变化。

在覆盖 49 个模型的 31,352 次重复评分中,日内分数的标准差为 2.80 分,按日计算的中位数在不同日期之间则为 8.43 分,约是前者的三倍。换句话说,跨日变化明显大于同一天里的正常起伏。作者同时强调,这不能直接证明供应商每天都在更换模型;任务构成、抽样、数据缺失、服务状态和测试方法调整都可能干扰结果。

真正值得带走的是监控思路:选型时别只比较某天谁分数最高,上线后也要持续复测同一模型,并保存测试配置的版本。只有先摸清日常波动范围,开发者才更有机会判断一次降分究竟是随机噪声、服务故障,还是较稳定的性能漂移。


供稿材料 SOURCES — 1

← 返回 2026-09-08 · 科技板块