让 AI 连续查资料、调用工具、完成一项长任务,像只在考试结束后告诉它总分:它知道成败,却不知道中间哪一步出了错。SEED 想补上这份“错题解析”。它面向长程 Agent——需要多轮观察、行动和反馈才能完成任务的 AI——把刚刚结束的任务过程重新读一遍,提炼成自然语言技能,例如可复用的流程、关键观察或避错规则。
最巧的一步是:SEED 固定 Agent 当时已经选过的动作,分别让同一个模型在“看不到技能”和“看到技能”两种条件下重新评分。技能让某个动作的概率改变了多少,就成为细到每个生成词元的训练信号。换句话说,它不再只靠最终成败这一笔总账,而能获得沿途的密集提示。
这也是“在策略蒸馏”:训练经验来自当前版本模型亲自走出的轨迹,并由最新模型同时负责行动和复盘;模型更新后,复盘能力也随之更新。技能只在训练时充当提示,部署时不需要额外记忆或提示词。作者称该方法在文字与视觉 Agent 任务上提升了表现和样本效率,但这些效果仍以论文自述为准。