传统 Transformer 像一栋层层加工信息的楼:过去内容在每层都留下笔记,但当前这一层通常只能翻同楼层的那一本。WhiteMatter 改掉了这条限制,让浅层也能读取过去 Token——模型生成的文本单位——在更深层形成的表示,因此值得关注:它为自回归模型增加了一条跨深度的历史信息通道。
具体说,每处理一个 Token,路由器会按其内容,把所有层的状态动态混合成若干共享的 KV 通道。KV 缓存就是模型保存的“索引和内容”,用于生成下一个 Token 时检索历史、避免重算。不同层读取不同通道,于是各层可以获得不同的深度组合;通道数还可少于层数,从而缩小缓存。
作者称,预训练实验中,完整缓存版本优于同深度的普通 Transformer,甚至略胜层数更多的基线;压缩缓存后仍保留大部分收益。不过供稿文本中的具体模型规模、困惑度与降幅数字缺失,暂时无法判断优势究竟有多大。