Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
PAPER 约 1 分钟

Agent服务别再反复分词

TokTier记住长对话的分词结果,只修补新增末尾,把Agent的重复CPU工作压到毫秒级。

编码Agent像在一份越来越长的工作记录末尾反复添几行:每轮改动很少,系统却常把整份记录重新“分词”——切成模型实际读取的token编号。论文分析153,951次调用发现,中位数每轮仅新增约1,400个字符,整个服务的提示缓存命中率却达94.1%。也就是说,模型端已经能复用大部分旧内容,CPU前端仍可能从头切一遍。

TokTier把分词改成有状态计算:保存上一轮的token,只重算新增文字和旧文本末尾的一小段。难点是,新字符可能改变原有的切分边界,旧结果不能直接拼接。它会逐次检查是否找到稳定边界;找不到就扩大重算窗口,最终退回完整分词,以保证结果与参考分词器完全一致。

作者报告,增量修补在10万至300万字符下耗时0.5—1.1毫秒;接入vLLM后,高负载时首个token的中位等待时间降低16%—34%。其17类分词器测试、12.4 TB文本扫描和9.3万余次Agent步骤回放未发现差异,但这些正确性与性能结果目前均来自论文作者的实验。


供稿材料 SOURCES — 1
01
TokTier: Exact Stateful Tokenization for Agentic LLM Serving arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-08-06 · 学术板块