给 AI 配的工具越多,越像给总机塞进一本不断改版的通讯录:只展示眼下相关的几页,能少读内容,却会让请求开头跟着变化,之前的计算也难复用。CacheRouter 试图拆开这个矛盾。提示缓存——服务端保存相同提示词前半段的计算结果——要求前缀稳定;工具路由则要从大量工具中找到合适的一个,尤其是那些不常用却偶尔不可替代的长尾工具。
它采用“双路径”:主模型始终只看到一小组固定核心工具;其他工具由独立的路由子模型搜索、调用,再把结果送回来。一个颇具体的设计是固定占位工具 TOOL_WHICH_WOULD_BE_USED:它不能真的执行,只负责告诉主模型“外面还有能力可找”,同时充当不随工具库扩张而变化的缓存锚点。工具可以动态增加,主模型请求的开头却尽量不动。
作者在 55 个功能查询和一段 30 轮对话上测试原型,自述 token 级缓存命中率分别达到 90.99% 和 95.2%;按 DeepSeek 当时缓存命中输入约为未命中价格三十分之一的计价,输入成本约降至无缓存基线的 12.0% 和 8.0%。这说明架构拆分可能比单纯压缩工具清单更有效,但目前证据仍来自规模有限的原型实验。