Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER H 12 约 1 分钟

LLM服务开始按延迟预算排队

Cascade按请求剩余延迟预算排队,让短问答与长推理混跑时少些超时。

短问答和长推理挤在同一条 AI 服务队伍里,先来先服务未必合理:短任务反复插队,长任务可能一直等;长任务先占住机器,又会拖慢所有人。Cascade 的做法,是为每个请求动态计算“延迟预算”——距离服务期限还有多久,再扣掉预计执行时间。真正快没余量的请求先处理,尚能等待的请求则承担更多排队和数据搬运开销。

它最值得注意的一点,是不只拿预算决定谁先跑,还用同一把尺子管理 KV Cache——模型为避免重复计算而保存的中间结果。系统会据此判断这些数据该留在高速显存、从较慢存储中提前取回,还是干脆重新计算。换句话说,排队与“草稿纸”放在哪里,不再各管一摊。

作者称,在三个大语言模型的生产请求记录上,Cascade 相比 vLLM 默认的先来先服务调度,最高将 goodput(在服务期限内完成的有效请求数)提升至 2.4 倍,并将违反期限的请求减少 40%。这些效果目前来自论文自述。


供稿材料 SOURCES — 1

← 返回 2026-08-13 · 学术板块