你每次找同一位助理聊天,它若都要重读你的偏好和旧对话,记得越多,开口越慢。InferScale想省掉这次次重复的阅读:把长期记忆预先算成KV缓存——模型读完材料后留下的“索引卡”——需要时直接放进GPU,而不是重新把原文塞给模型处理。
难点是,每次挑出的记忆不同,摆放位置也会变。InferScale用Chunked RoPE在注入时重新确定位置;又让每条记忆连同前面一小段对话一起编码,弥补单独处理时丢失的上下文联系。它通过vLLM接口实现,不改服务引擎,也不微调模型。
作者在LoCoMo测试中称,Llama-3.1-8B的首词延迟——从提问到吐出第一个词的时间——仅从16.6毫秒升至17.3毫秒,增幅4%;Mem0则从33.2升至68.3毫秒,增幅106%。代价是准确率略低:60.3%,对比Mem0的63.3%。这说明个性化服务的新瓶颈,可能不在“记住多少”,而在是否还要反复搬运和重算同一批记忆。