你换了一个 AI Agent,就像换了一个完全不了解你的新同事:偏好要重讲,项目背景要重补,过去踩过的坑还可能再踩一次。MindMemOS 想解决的,正是这种“换个工具就失忆”的问题。华为诺亚方舟实验室将它开源,试图把记忆做成独立于单个 Agent 的操作层,让事实、偏好和做事经验可以长期保存,并在后续任务中继续更新。
需要说明的是,本文发布信息、机制描述和实验数字均来自量子位对项目及论文的介绍,尚无第二个独立信源交叉验证;“可迁移”目前主要是架构能力,而不是已经得到独立量化证明的跨应用效果。
把零散便签改成时间档案
Agent 记忆并不是模型天然拥有、永久不忘的能力。它通常指把对话之外仍有用的信息写入外部存储,等以后需要时再找回来。
常见做法像往抽屉里塞便签:每段对话保存一块文本,提问时找出意思最接近的几块。问题在于,“用户以前喜欢 X”和“用户现在改用 Y”可能同时被翻出来,回答模型还得临场判断哪条有效。
据量子位介绍,MindMemOS 用 Entity、Property、Time 三个维度组织信息。Entity 是持续存在的对象,如用户、项目或文件;Property 是对象的事实、偏好和状态;Time 则记录这些属性何时成立、何时改变。换句话说,它不只保存最新答案,也保留旧状态如何被新状态取代。
系统提供两条写入路径。MindVanilla 不要求预先设计模板,可直接处理对话、文本和工具执行轨迹。MindSchema 则先规定系统应该关注哪些实体和属性。这里的 schema,就是一张“什么值得长期保存”的结构模板,不同业务可以换模板,不必重建整套记忆设施。
检索时,Compact Search 也不只寻找最相似的文本。它会分析问题,并沿实体、属性、关系和时间线走多条搜索路径,再判断信息是否足够。
记忆也需要定期整理
长期积累不等于把所有东西永远堆着。MindMemOS 的 Dreaming 机制会在离线阶段检查重复、冲突和演化关系,随后合并、补充或归档记忆。
例如,新事实替代旧事实后,系统会把旧版本归档,同时保留 supersedes——“新版本取代旧版本”的关系。这样,普通检索优先拿到当前有效信息,而不必每次都让回答模型重新解决冲突。
量子位援引项目实验称,在 MemoryAgentBench 的 FactConsolidation 测试中,Dreaming 将活跃记忆压缩了 19.4%—23.5%,问答准确率最高提高 10.3 个百分点。这里的“最高”只代表特定设置下的最佳结果,不能外推到所有任务。
另一套 Feedback 机制负责吸收纠正。用户可以直接指出错误,也可能只是在后续对话中表达不满或改变偏好。系统据此决定新增、更新、归档、删除或强化相关记忆。它要修的不是眼前一句回答,而是以后会反复影响回答的底层记录。
从“记住什么”走向“下次怎么做”
更值得关注的一步,是 MindMemOS 把 Skill 也纳入长期积累。Skill 可以理解为 Agent 执行某类任务时遵循的操作指南。系统收集真实执行轨迹,从反复成功的方法和常见失败中提炼规则,再生成带版本的新 Skill。
在包含 400 个真实表格操作任务的 SpreadsheetBench-Verified 上,材料称未经演进的初始 Skill 甚至不如不用 Skill;无监督演进把成功率从 51.3%提高到 55.3%,加入任务评分后达到 57.2%±2.4%。这说明一份固定指南未必有帮助,关键是能否从实际成败中修订规则及其适用边界。
基础记忆测试方面,材料报告 MindMemOS 在 LoCoMo 上得到 94.03 分,在 PersonaMem 上达到 70.63%。不过原始表格、完整基线、数据集版本和误差定义仍需进一步核对。
为什么这块基础设施值得看
多数 Agent 的记忆仍绑定某个应用或会话。MindMemOS 换了一个角度:记忆不再只是 Agent 内部的附属功能,而可以成为独立维护的长期资产。它既保存“发生过什么”,也记录事实怎样变化,还尝试把执行经验压缩为下一次可复用的技能。
如果这条路线成立,用户更换 Agent 时就不必从零开始,项目经验也可能随工具迁移。它触及的是长周期 Agent 的核心工程问题:能力不只来自一次回答有多聪明,也来自系统能否把昨天的经历变成明天可用的资产。
局限与未知
- 现有材料没有提供跨 Agent、跨框架或跨应用迁移的独立量化结果,因此“可迁移”尚不能视为普遍验证的效果。
- Dreaming、Feedback 和 Skill Evolution 的收益来自特定基准与设置,不能直接推广到所有 Agent 和任务。
- 关键实验数字目前只有单一机构相关信源,仍需结合原始论文核对评价指标、基线、模型配置及误差定义。