Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.056 — 2026-08-29
PAPER H 4 约 1 分钟

Agent投机解码开始适配批处理

AgentSpec让投机解码适应批量Agent请求,最高实现2.02倍加速

一群 AI Agent 同时干活时,有的在写代码,有的等搜索或 API 返回,进度很难对齐。服务器虽然能把请求凑成一批并行处理,却也容易被参差不齐的节奏拖慢。AgentSpec 要解决的,正是批量工具调用下的长延迟。

它采用投机解码:先快速起草一串 Token(模型生成文字的基本单位),再交给主模型一起核验。问题是,草稿一旦猜错,前面的计算就可能白费。论文发现,在代码生成 Agent 测试中,现有方法的投机 Token 拒绝率很高;最大批次超过 32 后,甚至比不投机的常规生成更慢。

AgentSpec 的关键做法,是只在 Agent 流程中语义连贯的片段内起草,避免跨越不同执行阶段乱猜;同时依据请求中的重复程度,动态分配可用于投机的 Token 额度。作者在 vLLM 上测试四个模型家族和多种 Agent 工作负载,自述其始终快于常规生成,最高达到 2.02 倍加速。


供稿材料 SOURCES — 1

← 返回 2026-08-29 · 学术板块