Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.043 — 2026-08-16
PAPER 约 1 分钟

模型排名会随思考预算翻盘

同一批模型,只因允许“想”的长度不同,排行榜就可能重新洗牌。

给四名选手做同一套题,却有人只能写半页、有人能写八页,这样排出的名次未必稳定。这里的“页数”就是生成预算——一次回答最多能用多少 Token(模型处理和生成文字的基本单位),也可近似理解为思考与作答额度。研究者让四个模型在 64 至 4,096 Token 的七档预算下完成三套推理题,共运行 56,476 次,发现三套题的模型排名都曾随预算改变,且多次变化达到统计显著。

预算增加也不总能换来更好答案。排除截断——答案碰到上限、尚未写完就被切断——之后,各设置中仍有 3.3% 至 19.1% 的题目出现“想得更多反而答错”的非单调表现。更关键的是,这种失误很挑模型:86% 至 94% 的相关题目只在一个模型上出现。换句话说,固定 Token 上限的排行榜更像特定赛制下的名次,而非模型能力的一张永久座次表;论文因此主张,评测结果应连同生成预算一起解读。


供稿材料 SOURCES — 1

← 返回 2026-08-16 · 学术板块