让 Agent 连查几十次资料再回答问题,像让团队做一场长项目:最后失败,不等于前面每一步都错了。但常见的结果奖励只在任务结束时打一个总分。一次末尾失误,可能让此前有效的搜索也背上负分;这正是长任务里的“信用分配”难题——要判断哪些步骤推进了目标,哪些步骤带偏了方向。
TRACE 的做法是,在每次工具调用后都做一次小检查:用一个冻结的参考模型——训练中不再更新、充当稳定标尺的模型——计算标准答案此时有多容易被预测。如果某轮搜索或读取结果让答案更可能出现,就给这一轮正向奖励;没有提供有效信息则接近零,带偏则为负。相邻两轮的变化通过时间差分(TD,即比较前后状态价值)转成逐轮奖励,并与最终成败的总奖励结合。作者称,这不需要额外训练评分模型,也不需要逐步人工标注;重复调用也不能靠堆次数抬高这部分累计奖励。论文报告其在长程搜索训练中更早开始改善、收敛更快,但供稿中的具体成绩数字缺失,因此这里不作量化引用。