把图片切得越细,视觉模型要处理的 token——图像被拆成的小块——就越多。标准注意力会让每个 token 都和其他 token 比一遍:数量翻倍,相关计算量大致变成四倍。SSOG-Attention 想绕开这笔越来越重的账,因此值得关注。
它不再显式计算所有 token 的两两关系,而是让每个注意力头学习少量高斯“原子”,再根据当前查询 token 调整这些原子的几何位置。所谓可分离高斯,就是把多维计算拆成各维的一维计算;多个原子相加,用来近似原本的注意力分布。项目作者称,这把计算复杂度从 O(N²·d) 降至 O(N·√N·d):序列越长,理论上的差距越明显。
作者还表示,SSOG 在小数据集 CIFAR-100 上优于 SDPA——标准的缩放点积注意力;在更大的 ImageNet-1k 上效果相当、收敛更快,并在规模增大时更省时间和内存。不过这些结论目前来自作者在 Reddit 的项目介绍,供稿未提供具体成绩、硬件条件或独立复现。说白了,它展示了一条有意思的替代路线,但近似注意力是否能稳定保住不同任务的效果,仍要看更完整的实验验证。