Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
PAPER H 61 约 1 分钟

个性化上下文不必反复搬

InferScale把反复调用的长期记忆预先算好并直接注入GPU缓存,让AI更快开口。

你每次找同一位助理聊天,它若都要重读你的偏好和旧对话,记得越多,开口越慢。InferScale想省掉这次次重复的阅读:把长期记忆预先算成KV缓存——模型读完材料后留下的“索引卡”——需要时直接放进GPU,而不是重新把原文塞给模型处理。

难点是,每次挑出的记忆不同,摆放位置也会变。InferScale用Chunked RoPE在注入时重新确定位置;又让每条记忆连同前面一小段对话一起编码,弥补单独处理时丢失的上下文联系。它通过vLLM接口实现,不改服务引擎,也不微调模型。

作者在LoCoMo测试中称,Llama-3.1-8B的首词延迟——从提问到吐出第一个词的时间——仅从16.6毫秒升至17.3毫秒,增幅4%;Mem0则从33.2升至68.3毫秒,增幅106%。代价是准确率略低:60.3%,对比Mem0的63.3%。这说明个性化服务的新瓶颈,可能不在“记住多少”,而在是否还要反复搬运和重算同一批记忆。


供稿材料 SOURCES — 1

← 返回 2026-08-02 · 学术板块