像会诊不必每次都叫满八位医生,AI 处理不同词时,也未必需要启用同样多的“专家”。混合专家模型(MoE)内部有多个擅长不同模式的子网络;传统 top-k 路由却不分难易,总选固定数量。Elbow 路由改为观察专家得分从高到低形成的曲线,在由陡转缓的“肘部点”截断:拐点前留下,之后舍弃。
它最实用的一点是无需重新训练,也不改模型权重。论文在 OLMoE 上以原有 top-8 为上限,只从既有候选中做减法。作者分析超过 200 万条路由概率曲线,称其中 99.7% 存在清晰拐点;六项基准测试中,每个词平均启用约 7.6 个专家,平均延迟下降 5.3%,准确率基本维持。换句话说,现成路由器的分数里可能已经藏着“该叫几个人”的信号。不过,目前结果只来自论文所测的 OLMoE 与六项选择题基准,能否普遍适用于其他模型仍待验证。