像讨论难题时,临近拍板再多请几位专家,反而可能少兜圈子。这项实验针对稀疏 MoE——一种每处理一个 token(模型处理文字的小单位),只调用少数“专家”模块的模型。作者没有重新训练 Qwen3.6-35B-A3B,而是在运行时调整路由器:早期层保持不变,只在更接近最终决策的后段 Transformer 层扩大专家选择预算,并让额外专家按线性规则逐渐减少。
作者将这种设置称为 Qwen3.6-35B-A4B+。在完整 MMLU-Pro 的 714 道题上,平均推理 token 据称减少 8.5%,延迟下降 10.9%;准确率为 84.5%,原始设置为 84.0%,差异在统计上不显著。这个结果有意思之处在于,它用更多单步计算换来更短的作答路径,而且无需微调权重。不过,推理 token 变少不等于实际耗时必然同比下降,目前材料也只给出单一模型与基准的结果,能否推广仍待验证。