Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.083 — 2026-09-25
NEWS 约 6 分钟

MiMo V3先亮出稀疏内核

小米先公开下一代MiMo拟采用的HySparse2:少算长输入,也少占显存。

IMAGE — r/LocalLLaMA 日榜

你让 AI 先读一个大型代码库,再根据多轮工具调用记录排查故障。它还没开始回答,就得先处理一大段输入。文本越长,这一步越慢,还要占用更多显存。小米 LLM-Core 于 9 月 22 日提交的 HySparse2 论文,瞄准的正是这笔“开口前的成本”:让模型少看一些无关内容,同时别漏掉藏在远处的关键线索。

这项工作也被视为下一代 MiMo 的前置信号。据 TechNode 报道,小米 MiMo 负责人罗福莉表示 MiMo-V3 将采用该架构。不过,截至相关信息发布时,公开的仍是架构论文,而不是 MiMo-V3 的模型权重或 API。因此,更准确的说法是:小米先亮出了拟用于 MiMo-V3 的稀疏内核,完整模型还没有登场。本文效果数字均来自论文作者,尚无第三方复现。

不必把整本书反复摊开

大模型处理长文本时,通常要让每个词与大量历史位置建立联系。这种机制叫“注意力”。上下文一长,计算量便迅速增加。

稀疏注意力的思路很直接:不让每个词查看全部历史,只挑一部分可能相关的位置。它像是在厚厚的资料中先圈出重点页,再细读这些页。难点也在这里:圈少了可能漏掉关键证据,圈多了又省不下多少计算。

HySparse2 把选择粒度从 block-level sparsity(按成块文本取舍)细化到 token-level sparsity(按单个词元取舍)。论文还强制保留最近一段滑动窗口——也就是始终查看邻近内容。这样,模型既能从远处挑线索,也不会丢掉眼前句子的连续关系。

两级共享,少存一份草稿

HySparse2 的另一条主线是 two-level KV sharing,即“两级 KV 共享”。KV Cache 可以理解为模型读完材料后留下的草稿:之后生成文字时直接查草稿,不必重新计算。上下文越长,这份草稿通常越占显存。

据 arXiv 论文摘要页,外层共享通过 KV Bridging 连接 self-decoder 与 cross-decoder;内层则沿用并改进 HySparse 的 KV Reuse。这里的 self-decoder 和 cross-decoder,可以简单理解为两组承担不同处理任务的解码模块。关键不在名称,而在于它们不再各自保存一套相互隔离的中间结果。

这套设计还改变了 prefill(预填充)阶段。预填充是模型开始回答前,先把整段输入读完并处理好的过程。论文称,HySparse2 在 self-decoder 完成后就能提前结束预填充,无需再执行 cross-decoder。对代码库、网页集合和长工具记录这类输入来说,少走这一段流程,可能同时减少计算和 KV Cache 占用。

数字显示,长到一定程度后差距拉开

作者在一个总参数量 80B、每次激活 3B 参数的 MoE 模型上测试。MoE 是“专家混合”架构:模型规模很大,但每次只调用其中一部分参数。

在平均成绩上,HySparse2 相比上一代 HySparse,MRCR-v2 提高 11.30 个百分点,RULER-v2 提高 19.81 个百分点。这两项基准主要用来检查模型能否在长上下文中找到并使用信息。

更直观的是 256k 上下文测试:HySparse2 在 RULER-v2 得到 58.45,HySparse 为 32.61,Hybrid SWA 为 35.74。Hybrid SWA 是一种混合滑动窗口注意力方案,也是 MiMo-V2 Series 使用的对照架构。至少按论文结果,HySparse2 并非只靠“少看内容”换速度,它在超长输入中的检索表现反而更高。

成本差异在更长输入下也很明显。输入达到 100 万个 tokens——token 是模型切分文字后的基本单位——HySparse2 的预填充 FLOPs 相比 HySparse 和 Hybrid SWA 分别减少 2.92 倍和 5.02 倍。FLOPs 是衡量计算工作量的指标。论文同时报告,它使用了更小的 KV Cache。

为什么值得现在追踪

Agent 往往不只处理一次提问。它要反复读取代码、网页、工具返回结果和此前对话。输入会越积越长,预填充计算和 KV Cache 因而成为实际瓶颈。HySparse2 的价值,不只是提出又一种稀疏规则,而是把“挑哪些内容看”“不同模块怎样共用中间结果”“预填充能否提前结束”放进同一套设计。

这也延续了一个有意思的发布节奏。据 Reuters 报道,2026 年 3 月,匿名模型 Hunter Alpha 曾在 OpenRouter 出现,并一度被猜测为 DeepSeek V4;小米后来确认,它其实是 MiMo-V2-Pro 的早期内部测试版。如今则是架构论文先于完整模型公开。外界得以提前看到技术方向,但最终产品表现仍要等 MiMo-V3 真正发布后才能判断。

局限与未知

  • 所有效果数字都由论文作者报告,尚无独立复现;AgentPPL 和 Repo Code PPL 还是内部基准。
  • “通用能力大体相当”只能谨慎理解。论文表格中的任务结果有升有降,HySparse2 在 MATH、DROP、GSM8K、HumanEval+ 等项目上低于部分基线。
  • 对照并非完全同条件:HySparse2 使用 MQA,对照组使用 GQA,Hybrid SWA 的全注意力层数量也不同。因此,KV Cache 和效率优势不能全部归因于稀疏机制本身。

供稿材料 SOURCES — 1

← 返回 2026-09-25 · 开源板块