让 AI 处理长文,就像让人边写边保留越来越厚的草稿:内容越长,翻找越费时。这里的“草稿”叫 KV Cache——模型暂存在 GPU 显存里的中间结果,能避免每生成一个新词都从头计算。论文分析称,在 Llama3-8B-Instruct 上并行处理 64 个请求时,它占到超过 90% 的内存访问。
HiKV 的关键是把筛选做两遍。第一层按注意力——模型对历史内容分配的关注程度——淘汰不重要的 token(文字基本小块);第二层再检查留下 token 的内部向量,只读取影响较大的元素。换句话说,不仅决定“哪几页草稿值得留”,还只取每页真正有用的几行。团队同时设计了可重构排序器,让同一套专用硬件支持两种筛选,额外芯片面积为 8%。
作者报告,在准确率损失不超过 1% 时,HiKV 的注意力计算最高加速 7.95 倍、能耗降低 90%。这些结果来自论文自身评测,但它值得关注之处很明确:压缩策略若没有相应的数据访问和硬件设计,省下的显存未必能直接变成实际速度。