你让 AI 连续改代码、填表单,做到一半才发现它早先走错了。此时只让它“忘掉后面的对话”并不够:文件已经改过,表单可能已经提交。就像游戏读档后,地图却没有复原,错误仍会沿着后续步骤放大。
AgentRewind 为长程 Agent——需要连续调用工具、改变外部环境的 AI 系统——加入成套的检查点。它同时保存 Agent 的上下文和受控环境状态;发现问题后,系统可以回滚到较早的快照,再带着上一次尝试得到的信息重新执行。关键不只是恢复“它记得什么”,而是连“它已经做了什么”也一起倒带。
作者还构建了 MettleBench,用一系列相互关联的工程要求衡量任务是否完成,以及中途推进了多少。作者自述,在多种任务、模型、执行策略和 Agent 框架下,AgentRewind 都提高了成功率与平均清单进度;但现有材料未披露具体提升数字,也未说明哪些外部操作能够安全回滚。