让 AI 读一本很长的书,麻烦在于:每写一个新词,它都要回看前文,文本越长,计算和“草稿纸”占用就越大。AoH 提出一条免训练捷径:不看实际输入,也不修改模型,只检查冻结参数里的查询—键几何——当前需求与历史内容如何匹配的数学结构——提前判断每个注意力头该不该保留全局视野。
具体来说,研究者用“有效秩”衡量一个头的匹配方向是否集中。方向少而集中的头更像检索员,需要翻遍全文;方向分散的头更偏向附近内容,只保留开头少量 Token 和最近窗口即可。论文在三个长上下文模型上报告:稀疏度为 50% 时,AoH 平均保留完整注意力 96.5% 的表现;在 256K Token 下,预填充与逐词生成延迟最多分别降低 41.4% 和 66.0%,KV Cache——模型保存历史中间结果的内存——减少 50%。这些效果均为作者实验结果,但它展示了一个有吸引力的部署方向:模型无需再训练,甚至无需先读样本,就能决定哪里值得省算力。