给 AI 更多时间,像让考生多写几份答案再挑最好的一份。数学题能验算,代码能跑测试;但医学建议、法律分析或创作没有唯一标准。此时,多花算力未必换来更好的最终回答。
Romano 等人把五类“测试时扩展”方法放在相同推理预算下,比较医学、法律、金融、聊天和创作五类开放式任务。作者发现,随着算力增加,候选池里最好的答案确实持续变好;真正卡住的是“利用”——模型或验证器无法稳定识别、整合已经出现的好答案。依赖验证器的树搜索还会让答案趋同,多样性只剩独立采样的 40%—60%。反复修改草稿只在五项基准中的一项带来真实改善。
相对而言,把多份候选重新综合成一份答案的 Fusion 最稳定,但也没有充分吃到候选池中的提升空间。论文因此提醒:开放式任务里,继续堆生成次数可能只是扩大“好答案已出现,却没被采用”的浪费;下一步更缺的,是可靠的判断与综合能力。以上效果均为作者在论文实验中的报告。