好比一场限时考试:聪明的考生会先拿稳容易、分高的题,遇到几乎做不出的难题也会及时停手。推理模型却不太会这样安排“考试时间”。这里的时间是推理Token预算——模型作答前用于中间推导的文字额度;多想通常意味着更高的成本和延迟。
研究者让多道数学题共享一笔Token预算,并改变同一组题的顺序、难度排列和分值,测试五个开源权重模型及两个DeepSeek-V4 API模型。作者发现,模型大多像贪心的流水线:按展示顺序解题,把较多算力花在前几题,越往后投入越少;题目增多后,这种顺序依赖更明显。即使明确要求模型先规划,它也只是把预算摊得更均匀,仍没有明显优先照顾高分题或更值得尝试的题。代码推理实验也出现了相似模式。
这项工作的提醒很具体:会为一道难题“想很久”,不等于会在一整套任务中判断哪里值得多想。传统逐题测试看不见这种差别,而在总成本或延迟受限的真实场景里,它可能正是关键短板。