Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.040 — 2026-08-13
PAPER HF 33 约 6 分钟

Motif 3:3140亿参数只激活132亿

Motif 3用384个专家撑起3140亿参数,每个词只调用其中8个,展示大模型如何兼顾容量与计算。

你去一家有384位专科医生的医院,每次看病不会让所有医生同时会诊。分诊台只找最合适的8位,但医院仍然拥有覆盖大量病种的完整团队。Motif 3的基本思路与此相似:它拥有3140亿个参数,每处理一个Token——模型读写文字时使用的基本单位——只激活约132亿个。

这是一种decoder-only模型,也就是按照已有内容逐步预测后续内容的语言模型。它采用MoE(Mixture-of-Experts,混合专家模型)架构:把模型的一部分拆成许多专家子网络,再由路由器为每个Token挑选少数专家。值得关注的不是单纯把参数做大,而是它如何让庞大的专家群在有限激活量下工作。

本文数据与效果均来自Motif 3技术报告,尚无独立信源交叉验证。

3140亿与132亿,不是同一个尺度

Motif 3共有53个Transformer层,其中2个是稠密层,51个是稀疏MoE层。每个MoE层包含384个可路由专家和1个共享专家;每个Token只选择8个可路由专家。

总参数像机构的全部员工,激活参数像处理一份任务时实际出勤的人。3140亿代表模型容纳知识和处理模式的总容量,132亿代表生成每个Token时参与计算的参数规模。细粒度稀疏路由让不同Token可以调用不同的8人组合,从而在相近的单次专家计算量下,获得更灵活的分工。

但这不意味着部署时只需保存132亿参数。其余专家虽然当下没有参与计算,权重仍要存放并在需要时调用。因此,“每Token激活132亿”不能直接改写成“显存占用等同于132亿稠密模型”,也不能据此断言实际推理成本就是后者的水平。

专家多了,分诊反而更难

384个专家带来的首要问题是路由。如果少数专家持续收到大量Token,它们会过载;长期无人调用的专家则得不到充分训练,最终可能出现专门化崩塌——名义上专家很多,实际却没有形成有效分工。

报告为此采用分层的专家均衡策略。它组合了基于sigmoid的路由、无需额外辅助损失的专家偏置、按序列计算的负载均衡目标、逐渐衰减的路由噪声,以及随层调整的辅助损失系数。直观地说,训练早期鼓励路由器多试几扇门,后期再减少随机探索,同时持续纠正拥堵和冷门专家。

每位专家还使用独立的Expert-Specific PolyNorm激活函数。激活函数决定子网络如何对输入作非线性响应;这里不同专家可以学习不同的响应曲线,而不是共享同一套固定规则。报告称,在约100亿参数模型的受控实验中,这种设计比SwiGLU保留了更高的专家门控权重有效秩,意味着门控变换保持了更多活跃方向。不过,这只是较小模型上的诊断结果,不能直接当成3140亿参数主模型的效果证明。

长上下文不只靠扩大窗口

Motif 3的注意力核心叫GDLA(Grouped Differential Latent Attention,分组差分潜在注意力)。标准注意力会给历史Token保存Key和Value,可以把它理解为模型阅读长文时留下的草稿。文章越长,这份KV Cache越大。

GDLA把两件事放到一起。差分注意力用一条信号路径减去一条噪声路径,试图压低无关或重复内容;分组设计把更多注意力头分给信号,只用较少的噪声头辅助过滤。潜在注意力则先把Key和Value压进较小的内部表示,以降低KV缓存需求。模型采用“1层完整因果注意力加3层滑动窗口注意力”的循环安排,训练上下文最高达到262,144个Token,也就是256K。

报告还列出一整套训练工程:专家计算和部分通信选择MXFP8低精度格式,关键优化状态继续保留FP32;融合内核减少中间结果搬运;长上下文阶段使用考虑窗口结构的上下文并行。专家并行被安排在单个八卡节点内,利用节点内部的高速连接完成Token派发与回收。这些设计说明,MoE的低激活量只是起点。要让384位专家真正高效工作,通信、内存和数值稳定性必须一起解决。

训练完,还要把七位老师合成一个学生

Motif 3使用约12.5万亿Token预训练,材料包括网页、STEM、代码、数学、合成问答、多语言和领域语料,并额外强调韩语、推理密集型样本以及法律、金融内容。

后训练分为多个阶段。团队先做通用监督微调,也就是用示范答案教模型按要求作答;随后训练6个经强化学习得到的专项教师,覆盖13个带验证器的领域,并用监督微调训练第7个软件工程教师。最后,Multi-teacher On-Policy Distillation把七位教师的能力汇入一个通用学生模型。它解决的是MoE之外的另一种“专家整合”:不是每次让用户选择不同模型,而是把专项能力集中到一个模型中。

为什么值得关注

Motif 3提供了一个少见的完整样本:模型容量达到3140亿参数,但每个Token只调用8个可路由专家;注意力侧压缩长文本状态,训练侧又针对专家均衡、低精度通信和激活异常逐层补强。它展示的新一代开放权重基础模型路线,不只是“更多参数”,而是把容量、激活量、通信成本和训练稳定性当作同一个系统问题。

报告称,Motif 3在长程智能体任务、数学推理、科学知识和对幻觉敏感的评测中,可与领先开放权重模型竞争。但报告摘要没有明确对手名单、具体分数、评测设置或统计显著性,因此目前更适合把它视为发布方的综合判断,而非已经得到充分验证的领先结论。

局限与未知

  • 报告未披露完整训练算力,也不足以判断这套3140亿参数架构的总训练与部署成本。
  • 现有材料没有说明数据去重、评测污染控制、许可证及权重是否实际发布,不能据此称其已经开源。
  • 多项架构收益来自发布方报告或约100亿参数模型的受控实验,缺少外部复现与主模型层面的充分对照。

供稿材料 SOURCES — 1
01
Motif 3: Technical Report Hugging Face Daily Papers · PAPER
原文 ↗

← 返回 2026-08-13 · 学术板块