Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
PAPER H 1 约 1 分钟

长任务Agent开始按轮次分奖励

TRACE把任务终局成败拆回每轮工具交互,让长任务Agent更容易学会哪一步真正有用。

让 Agent 连查几十次资料再回答问题,像让团队做一场长项目:最后失败,不等于前面每一步都错了。但常见的结果奖励只在任务结束时打一个总分。一次末尾失误,可能让此前有效的搜索也背上负分;这正是长任务里的“信用分配”难题——要判断哪些步骤推进了目标,哪些步骤带偏了方向。

TRACE 的做法是,在每次工具调用后都做一次小检查:用一个冻结的参考模型——训练中不再更新、充当稳定标尺的模型——计算标准答案此时有多容易被预测。如果某轮搜索或读取结果让答案更可能出现,就给这一轮正向奖励;没有提供有效信息则接近零,带偏则为负。相邻两轮的变化通过时间差分(TD,即比较前后状态价值)转成逐轮奖励,并与最终成败的总奖励结合。作者称,这不需要额外训练评分模型,也不需要逐步人工标注;重复调用也不能靠堆次数抬高这部分累计奖励。论文报告其在长程搜索训练中更早开始改善、收敛更快,但供稿中的具体成绩数字缺失,因此这里不作量化引用。


供稿材料 SOURCES — 1

← 返回 2026-07-19 · 学术板块