长对话一多,AI 的“草稿纸”就可能塞满。这里的草稿纸叫 KV Cache——它保存模型已读内容的中间计算结果,免得每生成一个词都重算全文。显存不够时,工程团队通常有两条路:增加 GPU,或把缓存压小。这项研究把两者放到同一条成本轴上比较,试图回答哪条路更划算。
作者用基于 A100、A40 和 H100 实机数据校准的模拟器,比较 Llama-2 7B 与 70B。最值得注意的不是谁在某个点胜出,而是根本没有统一的“交叉点”:作者估算,在 80 GB 显卡上,分界大约是 360 亿参数。模型低于这道墙时,压缩 KV 缓存通常更省钱;高于它时,模型权重本身就可能装不下,压缓存也无济于事,张量并行——把模型拆到多块 GPU 上共同运行——便成了入场条件。以 Llama-2 70B 为例,作者称它无论怎样调整 KV,都无法在单张 A100 上运行。
两种办法买到的东西也不同:加卡能改善延迟;压缓存能提高单位成本下的容量,却可能拖慢逐词生成。需要保留的是,这些结果来自模拟,作者没有自行使用 GPU 实测,也没有评估压缩后的回答质量,因此它更像一条容量规划原则,而非最终采购公式。