一个Agent连续搜索、调用工具,最后把任务做砸了,问题是:究竟哪一步出了错?常见训练只在终点给出成败分数,再把同一评价摊给整段过程,像项目复盘时让所有人一起背锅。轮次越多,错误归因和训练数据“来自旧版模型”的策略漂移也越严重,训练因此容易失稳。
RTPO(Reverse-Turn Policy Optimization,反向轮次策略优化)的关键,是从轨迹后段往前训练。它把多轮交互组织成稀疏的反向树,先更新靠近结果的决策,再把后续价值传回较早轮次;同时为每一轮构造可比较的后续分支,让信用分配——判断沿途哪些动作该记功、哪些该负责——更贴近实际因果关系。
作者称,在多轮Agent强化学习基准上,RTPO相较轨迹级和轮次级基线分别提升21.50%和10.76%。它值得关注的不是“倒序”这个形式本身,而是试图用同一套结构同时处理上下文错位、归因偏差和策略漂移;这些效果目前仍以论文实验为准。