Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.042 — 2026-08-15
PAPER H 28 约 1 分钟

推理模型不会自己分配思考预算

多道题共用一笔Token预算时,推理模型更看出题顺序,不太看难度和分值。

好比一场限时考试:聪明的考生会先拿稳容易、分高的题,遇到几乎做不出的难题也会及时停手。推理模型却不太会这样安排“考试时间”。这里的时间是推理Token预算——模型作答前用于中间推导的文字额度;多想通常意味着更高的成本和延迟。

研究者让多道数学题共享一笔Token预算,并改变同一组题的顺序、难度排列和分值,测试五个开源权重模型及两个DeepSeek-V4 API模型。作者发现,模型大多像贪心的流水线:按展示顺序解题,把较多算力花在前几题,越往后投入越少;题目增多后,这种顺序依赖更明显。即使明确要求模型先规划,它也只是把预算摊得更均匀,仍没有明显优先照顾高分题或更值得尝试的题。代码推理实验也出现了相似模式。

这项工作的提醒很具体:会为一道难题“想很久”,不等于会在一整套任务中判断哪里值得多想。传统逐题测试看不见这种差别,而在总成本或延迟受限的真实场景里,它可能正是关键短板。


供稿材料 SOURCES — 1

← 返回 2026-08-15 · 学术板块