Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.033 — 2026-08-06
PAPER 约 1 分钟

异构模型也能接力复用KV缓存

MoT把一个模型的“上下文草稿”翻译给另一个模型,减少多模型重复计算。

几位 AI 助手接力读同一份长材料,今天的做法通常像每换一个人,就得从第一页重读。原因是 KV 缓存——模型读文本时保存的中间计算结果——只适配原模型。架构或规模不同的“异构模型”,内部坐标系也不同,缓存无法直接交接;它们只能重复执行 Prefill,也就是重新通读提示并建立缓存。

论文提出 Mixture-of-Translators(MoT),用多个翻译模块把源模型的 KV 缓存转换到目标模型的表示空间,再用 Context Correction Loss(上下文校正损失)让转换后的运行轨迹贴近目标模型亲自阅读时的轨迹。一个具体发现是,交接太早会让翻译误差一路累积,太晚又会让最终状态偏移;MoT试图同时缓解这两种失败方式。

作者在 Qwen2.5、GPT-2 和 OPT 之间测试,并称长上下文缓存增强生成保留了直接输入原文时 96.3% 的质量。这意味着多模型协作有望复用已经读过的上下文,而非反复重算;不过该效果目前来自论文作者自述。


供稿材料 SOURCES — 1

← 返回 2026-08-06 · 学术板块