Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.076 — 2026-09-18
PAPER 约 1 分钟

前缀复用原来是排序题

把提示片段排对顺序,就能让更多请求共享“草稿”,少做17%—36%的预填充计算。

想象一批人都要查阅同一摞资料,只是每个人抽到的几页不同。若大家都从相同页面读起,服务器就能沿用已经算好的部分;页面顺序一乱,共享便会提前中断。这正是 RAG(先检索资料片段,再交给模型回答)、工具定义和少量示例带来的隐藏成本。

论文指出,前缀复用本质上不是“固定哪一页永远放前面”,而是给请求排序和分组。KV Cache——模型处理提示时留下的中间计算结果——只能在 Token 开头完全相同时复用。作者把请求组织成一棵前缀树:共享片段多的请求先聚在一起,再为每组安排片段顺序。一个反直觉结论是,全局固定顺序仅在每个请求最多包含两个片段时保证最优;片段达到三个,就可能出现更好的分组方案。

据论文作者报告,在三个 BEIR 语料库的 BM25 检索轨迹上,这种编排相较生产式 RAG 排序减少了17%—36%的 prefill(模型正式生成答案前,读完提示所需的计算);加入保持回答质量的顺序约束后,仍减少13%—23%。这意味着缓存效率不只取决于硬件和容量,也取决于服务层如何排列同一批材料。


供稿材料 SOURCES — 1
01
Prefix Sharing Is a Sorting Problem arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-09-18 · 学术板块