一群人登机,只要有一位迟到,全队就得等。大模型批量生成也一样:强化学习后训练和大规模评测会同时采样大量回答,少数异常漫长的输出却可能决定整轮何时结束。TailSieve 盯的正是这个“慢尾”问题。这里的 Rollout(轨迹采样)是让模型从输入开始,完整生成一次回答或行动过程;整批全部完成的时间则叫 Makespan。
它的关键不是删掉长回答,而是先生成一小段,把到截点仍未结束的请求标成下一轮的慢尾候选,再将它们放进低并发的独立资源池。作者发现,理想调度不该平均分配请求数量,而应隔离极长任务,同时让不同机器的完工时间尽量接近。系统还会根据历史工作量和实测吞吐,动态调整慢尾池的任务量与机器配额。候选请求会用当前模型从头生成,因此仍保持“在策略”采样。论文原文未给出可读的具体加速数字,效果幅度暂不宜量化。