问 AI 一个简单问题,也可能像派重型卡车送一封信:答案能送到,耗费却未必划算。这项工作研究 LLM 路由——像医院分诊一样,先判断问题需要多强的模型,再把它交给合适的模型处理。特别之处是,它不再拿模型大小、调用价格等指标估算成本,而是直接记录每次推理实际消耗的 GPU 能量;推理就是模型接收请求并生成答案,焦耳则是能量单位。
团队先让候选池中的九个模型逐一回答训练问题,记录正确性、延迟、功率和 GPU 能耗,再用这些实测结果训练一个小型语言模型充当路由器。奖励规则很直白:答错受固定惩罚;答对后,用电越少,奖励越高。路由器本身只输出“该选哪个模型”,不负责生成答案,因此也把调度开销纳入考虑。
在七项基准任务上,作者观察到约 60% 准确率附近存在明显转折:低于这一带时,系统可维持较低能耗;再追求更高准确率,就需要更频繁调用能力更强、耗能更高的模型。这个结果提醒我们,AI 服务的节能并非简单地多用小模型,而是学习何时值得为一道难题多花电。上述效果来自论文作者报告。