Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.036 — 2026-08-09
PAPER HF 76 约 8 分钟

AgentOPSD:给关键一步记功

AgentOPSD把长程任务的总奖励拆到关键回合,让Agent知道哪一步真正改变了结局。

AgentOPSD:给关键一步记功

你让 AI Agent 帮你完成一次网上购物。它先搜索商品,再筛选规格、比较选项,最后下单。任务成功了,训练系统却只会给整段操作一个“做对了”。于是,真正关键的筛选条件和无关紧要的页面跳转,得到的表扬几乎一样。任务失败时也如此:系统知道结果不好,却不知道该追责哪一步。

这就是长程 Agent 强化学习里的“信用分配”问题。强化学习(Reinforcement Learning, RL)让模型通过行动和奖励调整策略;但许多环境只在任务结束后给出奖励。AgentOPSD 想做的,是把这份总成绩重新分给中间的每一轮决策,尤其找出真正改变结局的关键一步。

Zi-Han Wang 等人在预印本《AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning》中报告了这套方法。下文的技术细节和实验结果均来自作者论文,目前没有独立复现或同行评审材料交叉印证。

总分知道了,功劳却没分清

一条“轨迹”,就是 Agent 从开始到结束的整串操作。GRPO——一种按同组任务结果比较和训练模型的方法——先根据最终成败算出整条轨迹的优势,再把它近乎统一地分给沿途所有输出。

问题在于,一条成功轨迹也可能包含绕路和误操作;一条失败轨迹里也可能有几步判断完全正确。轨迹越长,用一个总分覆盖所有决策就越粗糙。

更细的办法通常要训练 critic——专门估计当前局面价值的模型,或者从中间状态继续尝试许多次,也就是增加额外 rollouts。AgentOPSD选择了另一条路:不另训 critic,也不额外采样轨迹,而是从自蒸馏信号中寻找证据。

自蒸馏(Self-Distillation)通常指模型向自己的“更强版本”学习。这里并不是让模型一轮轮反复自我训练。论文让同一个模型用两种条件评估已经生成的动作:学生分支只看正常交互历史;教师分支还会看到训练阶段检索到的 privileged skill,即描述有用子目标和行动模式的额外提示。这些技能只在训练时使用,推理时不需要。

先把字词信号拼成一次决定

语言模型会给每个输出 token——大致可理解为一个字、词或词片段——分配概率。教师与学生对同一 token 所给对数概率的差,叫作 log-probability gap。差距为正,意味着额外技能让教师更认可这个输出。

但 Agent 与环境的互动单位不是单个 token,而是一整轮动作。比如“拿起杯子并放进水槽”可能由许多 token 组成,环境要等整句话执行完才反馈。因此,AgentOPSD先把一轮内所有 token 的差距加总,得到 turn-level evidence,也就是“这一轮行动对成功有多大支持”的证据。

这只是第一步。单看一轮的分数,仍然不知道它是关键转折,还是在重复一个早已明确的结论。

关键不在证据多大,而在它改变了什么

AgentOPSD维护一个随交互推进的 belief state——根据目前历史,对整条轨迹最终成功可能性的相对判断。起点取同一 GRPO 组里的平均成功率,随后每一轮都把新证据加入,并让较早的证据逐渐衰减。

更新在 log-odds 空间进行。若成功概率为 p,它的 log-odds 是:

logp1p

这样,逐轮证据可以像账本一样递归累积。这里的“递归”,指上一步的 belief state 会成为下一步更新的基础。

每一轮得到多少信用,不只取决于本轮证据本身,而取决于更新前后 belief state 改变了多少。若系统原本对成败拿不准,一条新证据可能明显扭转判断;若此前证据已经让判断接近饱和,同样的信号就可能只是重复确认。

可以把它理解为会议表决。第一个提出决定性事实的人可能改变全场意见;后来再说一遍同一事实,内容没错,但边际作用很小。AgentOPSD要找的正是这种“边际修正”。

最终结果还会校正修正方向。成功轨迹中,提高成功判断的转折应多记功;失败轨迹中,同样的向上修正反而与结果矛盾。方法随后在单条轨迹内标准化这些信用,用一个有界且始终为正的倍数调整GRPO优势的强弱。因此,它不会把原本的训练方向彻底反转,只会放大更值得学习的回合、减弱次要回合。

结果支持了这套直觉吗?

作者在三个交互环境中测试了 AgentOPSD:文本家庭任务 ALFWorld、模拟购物环境 WebShop,以及需要检索信息作答的 Search-QA。模型使用 Qwen2.5-3B-Instruct 和 Qwen2.5-7B-Instruct;论文称各方法共享骨干模型、数据和预算。

最醒目的结果来自 ALFWorld。使用 Qwen2.5-7B 时,AgentOPSD的平均成功率为 89.1%,高于 GRPO 的 81.2%。同一设置下,逐步但不递归处理局部信号的 StepOPSD 为 88.4%,表现很接近;AgentOPSD并非在每项比较中都大幅拉开差距。

在 Qwen2.5-3B 上,AgentOPSD的 ALFWorld 平均成功率为 84.4%,与 SDAR 持平;WebShop 得分为 90.4,高于表中其他方法;Search-QA平均值为 46.7。作者进一步汇总称,AgentOPSD在两个模型规模的八项聚合比较中全部超过 GRPO+OPSD、Skill-SD 和 RLSD,并在其中六项超过 SDAR。

消融实验更能说明“关键一步”来自哪里。以 Qwen2.5-7B 的 ALFWorld 为例,完整方法为 89.1%;把回合级累计改成 token 级累计后降至 85.9%;不用历史相关的递归修正、只看当前局部差距时降至 82.8%。去掉与最终成败对齐的正负方向后为 80.5%,取消基于组成功率的初始锚点后为 78.9%。这些作者自报结果支持了两个核心设计:先按完整动作聚合,再根据历史判断这一步究竟改变了多少。

为什么值得关注

AgentOPSD真正有意思的地方,不是又造了一个更密的奖励,而是重新定义了“关键”:关键决策不是局部分数最高的那一步,而是最能修正当前成败判断、并且修正方向与最终结果一致的那一步。

这也补上了轨迹级奖励的一个明显缺口。最终验证器仍负责告诉模型整件事做对还是做错;自蒸馏证据则负责在内部重新分账。两者各做一件事,方法还能接入标准策略优化,不需要额外轨迹或单独训练价值模型。

代价并没有消失。论文说明,该方法仍需一次教师分支的 forward pass——即让模型额外跑一遍概率计算。所谓“不需要 extra rollouts”,只是不必重新探索更多轨迹,不等于没有额外训练计算。

局限与未知

  • 所有效果目前都来自作者论文。尚无独立复现或同行评审,89.1%及领先基线的结论不宜直接泛化为全面领先。
  • 论文表格给出了多个基准成绩,但材料未报告方差、重复运行次数或统计显著性;一些接近的差距是否稳定,仍不清楚。
  • 教师分支依赖训练阶段检索到的技能。论文称各相关基线使用相同信息与预算,但这种成功相关提示能在多大范围内获得、其教师计算成本如何影响实际训练,仍需进一步评估。

供稿材料 SOURCES — 1

← 返回 2026-08-09 · 学术板块