Agent不断读入长文档和工具返回结果,就像桌面上的资料越堆越高:真正回答前,光把材料过一遍就可能耗掉大量算力。小米LLM-Core团队在MiMo-V2.6发布后,预告了可能用于下一代模型的HySparse2架构。它不是完整的MiMo-V3,而是一套面向长时程、多轮Agent工作负载的稀疏注意力骨架——只查看部分相关Token(文本的基本单位),减少处理长上下文的成本。据团队9月22日公开的HySparse2论文,作者包括罗福莉。
最值得看的是它对Prefill的处理。Prefill是模型正式逐字回答前,先读完整段输入的阶段。HySparse2让KV Cache——保存历史Token中间结果的“草稿纸”——在前半段解码器结束时即可构建,并通过两级共享减少重复存储;稀疏选择也从整块文本细化到单个Token。论文测算,在100万Token上下文下,其Prefill计算量较HySparse和Hybrid SWA分别减少2.92倍和5.02倍,FP8 KV Cache占用为2.69GB。团队还报告它在同等训练条件下的长上下文检索和多轮任务指标领先。需要澄清的是,论文只把DeepSeek MLA列为相关的KV压缩路线,并未称其被直接纳入架构;完整MiMo-V3目前也尚未发布。