像分组结账一样,每组人数相同,不代表都能同时结完:有人只买一瓶水,有人推着满车商品。MoE(Mixture of Experts,一种每个Token只调用少数“专家”子网络的模型)也有类似问题。不同专家分布在多张GPU上,每层必须等最慢的卡完成;因此,平均分配Token看似公平,却未必最快。
TEMPO直接优化Makespan——整批任务全部完成所需的时间,也就是最慢GPU的耗时。关键在于,专家任务有时受显存读取限制:哪怕Token很少,加载一次专家权重也有固定成本;有时又受计算限制,而且计算会按128个Token的块向上补齐,拆散任务反而制造额外计算。论文记录的解码批次中,92%至100%同时包含这两种状态,这解释了为什么单纯数Token或数已启用专家都可能失准。
作者称,在校准后的测试网格中,TEMPO始终距最佳固定策略不超过1%,混合状态下最高改善15.5%;不过较大收益包含EP32至EP64的模型外推,论文也明确强调,它预测的是适用区间,并非所有部署都能获益。