让 AI 读长文时,注意力会检查当前位置与前文各处的关联。但很多关联几乎不起作用,常规做法仍会把后续计算全部做完。MassAlloc Attention(MALA)像先快速过目、再决定哪里值得细算:它保留所有合法位置的打分机会,再依据注意力权重——各位置对当前输出的贡献比例——跳过低价值的后续步骤。
关键不只是“少算”,而是把判断放进融合内核——GPU 一次完成多道步骤的底层程序——并同时覆盖前向计算和用于训练的反向传播。它不需要额外保存筛选掩码,训练和推理也共用同一套容差规则。在后续计算总量完全相同的 8K 对照中,作者报告 MALA 平均漏掉的注意力质量为 0.0188%,接近按样本预知最佳选择的参考方法 0.0182%;14B 模型进行 32K 长上下文训练时,总训练 FLOPs(浮点运算量)减少 23.1%。不过它仍会计算全部 QK 关联分数,因此省下的是打分之后的工作,并未消除注意力随长度平方增长的部分。