让AI智能体办一件事,往往不是只问一次模型,而是在“规划—行动—观察”的循环里调用数百次。填写工具参数、做是非判断这类小活,如果次次都交给最贵的模型,账单和等待时间都会随循环一起膨胀。
据InfoQ报道,Microsoft公布了一套部署在Azure Kubernetes服务上的参考架构。它用RouteLLM做“语义路由”——先看请求内容,判断便宜模型能否胜任;再由agentgateway管理认证、限流和成本,最后根据GPU队列与缓存状态选择具体计算实例。RouteLLM测试显示,在达到GPT-4约95%质量水平时,仅约26%的调用需要升级给GPT-4,相比全部使用强模型最高节省85%成本。
不过,这不是开箱即得的折扣。Microsoft明确提醒,该结果只适用于测试中的模型组合;企业仍需按自身流量校准路由门槛,模型切换造成的缓存失效也可能侵蚀节省。