一群 AI Agent 同时干活时,有的在写代码,有的等搜索或 API 返回,进度很难对齐。服务器虽然能把请求凑成一批并行处理,却也容易被参差不齐的节奏拖慢。AgentSpec 要解决的,正是批量工具调用下的长延迟。
它采用投机解码:先快速起草一串 Token(模型生成文字的基本单位),再交给主模型一起核验。问题是,草稿一旦猜错,前面的计算就可能白费。论文发现,在代码生成 Agent 测试中,现有方法的投机 Token 拒绝率很高;最大批次超过 32 后,甚至比不投机的常规生成更慢。
AgentSpec 的关键做法,是只在 Agent 流程中语义连贯的片段内起草,避免跨越不同执行阶段乱猜;同时依据请求中的重复程度,动态分配可用于投机的 Token 额度。作者在 vLLM 上测试四个模型家族和多种 Agent 工作负载,自述其始终快于常规生成,最高达到 2.02 倍加速。