Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.049 — 2026-08-22
PAPER 约 1 分钟

冻结Transformer也能外挂长记忆

MoNe给冻结Transformer外挂可更新记忆,读到128K上下文也无需重训主模型。

你让 AI 读一部长篇记录,再问开头藏着什么,它往往越读越吃力。MoNe 的思路是给现成的 Transformer 外挂一册可更新的“笔记”,而不是重新训练主模型。这里的“冻结”指主模型参数保持不变;它只在处理当前材料时更新外挂的神经记忆——一个把读过内容压进内部状态的小型网络。

MoNe 先把长文本切成固定大小的段落,逐段写入记忆。提问时,主模型不再重读原文,而是由问题本身从记忆中生成注意力所需的键和值——可理解为供模型查找和取用信息的索引与内容。最值得注意的是,这份记忆还能供多个问题重复使用,新材料到来时也可接着写入。

作者称,MoNe 只增加 6.4% 的参数;在 128K token(文本被模型切分后的基本单位)下,相比把全文直接塞进提示词,计算量和峰值显存都约降 80%。它仅用最长 4K token 的上下文训练,却在 RULER 的信息查找与词语提取测试中扩展到 128K。结果仍属论文作者自述,实际效果会怎样,还要看更多模型和真实任务的检验。


供稿材料 SOURCES — 1

← 返回 2026-08-22 · 学术板块