Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER H 7 约 1 分钟

长上下文可压成答案对齐记忆

把长文压成面向答案的少量记忆向量,同时减轻注意力计算与显存压力。

让 AI 读一本很长的资料再回答问题,麻烦不只在“记不记得”:它每生成一个词,都要回看大量内容,还得把读过内容的计算笔记留在显存里。后者叫 KV 缓存,文本越长通常越占空间。CMC 的思路是先把原文压成少量“记忆嵌入”——用一串数字浓缩内容,并专门保留对作答有用的信息,再交给原有模型回答;解码模型本身无需改动。

最值得注意的是,它并非把所有压缩记忆一股脑塞给模型。系统会按问题与记忆的相似度挑选相关部分,同时保留一小段未压缩的局部原文:前者照顾全局线索,后者保存精确措辞。压缩器还分两阶段训练,先学习重建上下文,再利用答案监督,让记忆更贴近真正要回答的内容。作者称,在九种编码器—解码器组合和四个问答基准上,CMC 均优于对照方法;SQuAD 上最高提升 7.3 个 EM 点和 4.0 个 F1 点,推理时间与能耗最多下降 20%,生成阶段峰值预留显存最多下降 50%。这些效果目前以论文自报实验为准。


供稿材料 SOURCES — 1

← 返回 2026-09-26 · 学术板块