让 AI 连续完成找资料、比商品、下单这类长任务,难点不只是最后做没做成,还在于中途哪一步做对了。稀疏奖励——往往只在任务结束时给一次成败反馈——很难回答这个问题;即使教师逐步指导,机械地把“第十步”对齐“第十步”,也可能对错对象,因为师生可能在不同位置做出同一个决定。
AlignOPSD 的关键做法是先找“功能上相同的决策”,再分配功劳。它从同一任务的多条执行轨迹中寻找匹配情境,把学生已经生成的同一回答放到这些情境下重新评分,而不是照抄教师答案;随后根据对应关系的变化划出长短不一的决策段,让跨越多轮的一个决定整体获得反馈。这里的在线自蒸馏,是学生按当前策略行动,再由拥有额外任务信息的同一模型提供监督。
作者在 ALFWorld、WebShop 和 Search-QA 上测试 Qwen2.5-3B 与 Qwen2.5-7B。按论文报告,AlignOPSD 在八组“模型—汇总指标”比较中均优于 GRPO,提升 5.5%–8.7%,并在其中六组排名第一。结果说明,长程 Agent 的监督单位或许不该是钟表般整齐的时间步,而应是实际正在完成的决定。