Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.026 — 2026-07-30
PAPER H 6 约 1 分钟

冻结权重的Agent也能边用边学

Agent不改底座参数,也能把部署反馈写成经验,供下次任务调用。

同一道棘手的客户请求,Agent 今天解决了,明天却可能又从头摸索。这项工作给它配了一本“经验笔记”:底座模型的权重——训练后形成的内部参数——保持冻结,每次任务结束后,系统把成功、失败或事后纠正提炼成自然语言规则,存进外部记忆,遇到相似任务时再检索调用。这样,学习发生在模型之外,不必频繁重新训练。

作者在 τ-bench 的银行任务上测试了这套方法。作为对照的 Agent 已能检索约 700 份完整政策文件,因此新增收益主要来自经验记忆,而非补充资料。按作者报告,只给任务“成功或失败”这一比特的反馈,单次成功率便达到静态 RAG——即只从固定资料库检索信息——基线的 1.6 倍;若失败后再提供正确处理方式,则达到 2.6 倍,并解决了基线始终做不出的 84 项任务中的 22 项。结果也在第二个模型上复现。

更有意思的是,两种模型还能读取对方积累的记忆,并超过各自没有记忆时的表现。这说明经验有机会从单个 Agent 的临场所得,变成可共享的组织知识。不过,这些效果目前来自论文所设银行基准,能否在更杂乱的真实部署中长期保持,材料尚未给出答案。


供稿材料 SOURCES — 1

← 返回 2026-07-30 · 学术板块