像复盘一场球赛,只看哪次传球“姿势正确”,未必能知道它是否真的改变了胜负。训练 Agent 也有同样的问题:系统需要做“信用分配”——把最终成败归到具体动作上,决定以后奖励哪一步。Haiyue Zhang 的这项研究发现,常用的逐步训练信号,包括 LLM 裁判打分、结合结果计算的概率分数,以及模型自己的信心,都没能比随机猜测更可靠地找出真正影响结局的动作。
研究在 ALFWorld 工具环境中做“因果回放”:到每个决策点换一个模型本来也可能选择的动作,再把后续过程重新执行到底,看结果是否改变。在 Qwen2.5-7B 的 2,034 个介入点中,1,768 个能构造有效对照;其中只有 30.5% 显示出可测量的因果作用。换句话说,多数步骤即使看起来合理,也未必左右成败。论文还报告,七组预注册训练实验没有一组可靠超过未训练策略;表面差异可由训练量解释,而非信用信号的内容。结论目前限于可回放的单 Agent 环境,且“无作用”只表示在现有采样精度下未测出差异。