Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.034 — 2026-08-07
PAPER H 25 约 1 分钟

长程Agent先学会挑记忆

MemArbiter不只帮 Agent 找回记忆,还在行动前挑出真正有用的部分。

你翻出一叠旧笔记,不代表眼前就能做对决定:关键提醒可能夹在过时记录里。长程 Agent——需要经历多轮观察、操作和反馈的 AI——也有这个问题。记忆已经找到,却没能影响正确动作,作者称之为“Memory-Action Gap”(记忆—行动鸿沟)。MemArbiter 的思路,是把最后一次筛选推迟到真正决策之前。

它先把交互历史拆成独立小条目,再按目标、任务状态、约束、过往尝试和参考事实,放进五类 Memory Banks(功能记忆库)。每次行动前,系统判断眼下更需要哪类信息、哪些条目最相关;重要内容用详细的 focal 形式呈现,次要背景压成简短的 ambient 形式,并通过时间门控决定升格、降格、保留或隐藏。说白了,它不只负责“搜笔记”,还负责临场排版。

在 ALFWorld——用于测试 Agent 完成一连串环境操作的基准——上,各方法每一步使用相同记忆额度。论文作者报告,采用开放权重的动作生成模型时,MemArbiter 在 500 和 750 token(模型处理文字的基本单位)额度下,成功率分别为 82.8% 和 92.5%,比最强基线高 20.9 和 25.4 个百分点。结果目前来自论文自身实验,边界也很清楚:它改善的是记忆管理造成的失误,并不等于解决模型本身的推理局限。


供稿材料 SOURCES — 1

← 返回 2026-08-07 · 学术板块