让视频模型少看一些无关位置,听起来就能省算力。难点是,硬件喜欢成组干活:一组查询必须共享要访问的数据块,但组内成员关注的位置未必相同。各自都很“专注”,合并路线后仍可能要查看大量位置;强行删减,又会漏掉影响输出的联系。
SparsePR把这一步做成了可执行方案。它先按当前注意力调用中的响应关系,为查询以及成对的键和值分组,让共享路线尽量照顾组内需求;再抽取少量查询,计算完整注意力作为“探针”,拟合一次调用专用的仿射修正,用稀疏输出估计被跳过连接造成的残差。这里的残差,就是省略连接前后,最终注意力输出的差异。整个过程不需额外训练。
作者在四种视频生成与世界模型上报告:实际执行的查询—键配对密度为22.0%至26.0%,端到端加速1.48至2.61倍,同时保持生成质量。消融实验显示,误差下降主要来自探针拟合;响应耦合分组则减少直接丢弃带来的误差,并在探针数量有限时改善重建。