Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
PAPER H 7 约 1 分钟

Agent推理开始利用不对称上下文

让小模型读完整记录、大模型只看压缩版,AsymSpec试图兼顾Agent速度与准确率。

Agent每查一次资料、调用一次工具,历史记录都会变长,像办事员桌上的文件越摞越高。直接压缩记录能省时间,却可能删掉后面推理需要的细节。AsymSpec提出一种不对称做法:让轻量的草稿模型读取完整上下文,让计算更重、负责最终把关的验证模型只读压缩版。

它改造了投机解码——先由小模型起草一串词,再交给大模型批量验收。最巧的一步是让同一个草稿模型分别读取完整与压缩上下文,再比较两次输出;两者之差被视为“被压缩内容带来的信息”,用来引导验证模型。系统还会根据两份上下文的差异程度调节引导强度,避免草稿干扰最终判断。

作者报告称,在四类Agent能力和两个端到端Agent基准上,AsymSpec平均恢复了完整上下文方案90%的准确率;在单项文本能力测试中,吞吐量提高到1.3至1.7倍,计算成本降至0.2至0.3倍。它的价值不只是“少读一点”,而是让昂贵模型少读、便宜模型多读,重新分配长上下文的计算负担。


供稿材料 SOURCES — 1

← 返回 2026-08-30 · 学术板块