几位 AI 助手接力读同一份长材料,今天的做法通常像每换一个人,就得从第一页重读。原因是 KV 缓存——模型读文本时保存的中间计算结果——只适配原模型。架构或规模不同的“异构模型”,内部坐标系也不同,缓存无法直接交接;它们只能重复执行 Prefill,也就是重新通读提示并建立缓存。
论文提出 Mixture-of-Translators(MoT),用多个翻译模块把源模型的 KV 缓存转换到目标模型的表示空间,再用 Context Correction Loss(上下文校正损失)让转换后的运行轨迹贴近目标模型亲自阅读时的轨迹。一个具体发现是,交接太早会让翻译误差一路累积,太晚又会让最终状态偏移;MoT试图同时缓解这两种失败方式。
作者在 Qwen2.5、GPT-2 和 OPT 之间测试,并称长上下文缓存增强生成保留了直接输入原文时 96.3% 的质量。这意味着多模型协作有望复用已经读过的上下文,而非反复重算;不过该效果目前来自论文作者自述。