同一辆出租车坐得更远,平均每公里费用会下降,但总车费仍会上升。大模型也一样:服务按 Token——模型读写文字的小片段——计价,GPU 却为整段推理窗口耗电。只看“焦耳/Token”,可能把摊薄固定开销误当成真正节能。
研究者把一次推理的能耗拆成两部分:先做 Prefill,也就是通读输入、建立上下文,再承担生成前的固定开销;之后每生成一个 Token,逐步增加能耗。在 H200 上运行 Llama-3.2-1B、批量为 16、输入长度为 4K 时,输出从 10 个 Token 增至 512 个,平均能耗由 7.46 降至 0.72 焦耳/Token,但整个批次的推理窗口能耗反而从 1.19 升至 5.93 千焦。
这意味着“每Token更省电”可能只因固定成本被更多输出分摊。作者据此主张,评估和调度模型服务时,应同时看整次请求能耗与单位Token能耗,不能只优化一个漂亮的平均数。