想象几位助理先读同一份厚手册,再各写一份长短不一的答复。若仓库只提供同一种箱子,要么手册被拆得零散,要么短答复占着大箱子的空位。多 Agent 服务里的 KV cache——模型为避免重复计算而保存的临时记忆——也有这个问题:共享前缀适合整块复用,各自生成的独立后缀则需要灵活分配。
GraniKV 的关键做法是不再“一刀切”。它把共享前缀放进连续的 HOT pool,让系统能整段读取;后缀和新生成的词放进按单个 token 分配的 COLD pool,减少页内空置。系统还会在每一步判断当前更受算力、内存读写还是机器间通信限制,再从两种注意力后端中选择合适的一种。
最值得注意的是作者报告的异构场景:当多个 Agent 的提示词不同、长度也不一时,面向整批请求的共享前缀优化退回到与基线相当,收益反而主要来自这套非对称存储。换句话说,GraniKV 的价值不只在“读得更快”,更在于按两类内容的真实形状分配空间。供稿中的关键吞吐数字存在缺失,因此这里不转述具体倍数。