多人同时使用大模型时,同一位企业客户的请求如果每次被分到不同服务器,就像每次都换一家没有病历的诊所:模型得重新通读输入。这个过程叫预填充(prefill);前缀缓存则保存重复开头的中间计算结果,也就是 KV Cache,省去重算。问题在于,把请求固定送回有缓存的服务器,又可能让热门服务器排起长队。
CacheRoute 的做法是先根据各类请求的频率,定期生成一张稳定的路由表:优先给高频前缀安排“常去”的服务器,并按预计负载摆放;未纳入的请求仍交给普通负载均衡。在主实验中,它服务运行于 60 张 H100 GPU 上的 Llama-3.3-70B。作者报告,在每秒 100 个请求时,其 p99 延迟——99% 请求能在此时间内完成——为 1.8 秒,五种对照方案则为 3.8 至 8.5 秒。不过,两个 32B 工作负载也出现收益缩小或消失的反例:缓存省下的计算不够多时,残余的负载倾斜反而拖后腿。因此作者建议部署前先用真实流量做影子回放,而非只看统计数据就开启亲和路由。