让 AI 连续协助几百步,就像让人只靠一本越写越厚的会议记录工作:翻阅越来越贵,旧事压成摘要又容易漏掉关键细节。长周期 Agent——能规划步骤、调用工具并继续行动的 AI 系统——因此常受上下文容量和调用成本限制。ABBel 想换一种记法:不再反复压缩全部历史,而是维护一份自然语言“信念状态”,记录任务中的未知事项和当前判断。
这份状态会在每次获得新观察后更新,并取代完整交互历史,成为 Agent 决定下一步时直接参考的工作上下文。方法里最值得注意的一步,是对每轮信念状态的内容进行评分监督:训练目标不只看最终行动是否成功,也检查 Agent 究竟记住了什么,从源头约束信息质量。作者认为,这能缓解递归摘要在多轮压缩中逐渐丢失决策细节的问题。不过现有供稿未披露完整实验数字,实际能节省多少成本、能否稳定迁移到不同长任务,仍需结合论文结果判断。