多Agent系统像一个分工小组:有人规划,有人执行,有人检查。最终答案出错时,难点不只是“怎么改提示词”,而是先找出究竟哪个角色该负责。以往方法可能轮流修改,甚至一起重写,既费时间,也容易改错地方。AgentGrad想把这一步自动化。
它的关键做法是“逐个干预”:一次只改变一个Agent的行为,例如给它额外提示,再观察整个系统能否转败为胜。若能,就把该Agent视为本次故障的修改目标,并把干预后的输出当作参考答案。系统随后生成“文本梯度”——不是数学公式,而是一段说明失败原因和修改方向的自然语言批注,用来重写对应提示词。
AgentGrad还会把含义相近的批注聚在一起,提炼共同的纠错规律,避免把无关问题混成一条指令。作者称,它在问答、事实核验、指令遵循、隐私委派和数学推理等五类基准上,使用Qwen3-8B与GPT-5-mini时均优于TextGrad、GEPA等对照方法。更值得关注的是,它把“谁该改”也纳入优化流程;但能否替代真实系统中的手工联调,仍需更多场景验证。