像把任务分给一大群员工:每次只叫少数人上场,热门员工很快排起长队,其他人却没活干。超稀疏混合专家模型(MoE——把模型拆成许多“专家”,每个词只交给少数几个处理)也会遇到这种失衡。它虽能用近似不变的单词计算量扩充参数,却可能浪费模型容量、拖慢训练,甚至引发训练震荡。
论文提出 ID Balancing,把工业控制常用的 PID 思路搬进专家路由。它用每层各专家接收的词元数量作为反馈,再调整专家的路由偏置。最关键的一步是:积分项会按失衡幅度决定调整力度,偏得多就多纠正,接近平衡就轻推;微分项只在失衡继续恶化时介入,相当于发现队伍越排越长才额外踩刹车。方法还会在每次更新后重新居中偏置,并且不向语言模型的训练目标加入额外的均衡梯度。
作者将 DeepSeek 的无辅助损失方法解释为固定步长的积分控制,将 Kimi K3 的 Quantile Balancing 解释为广义比例控制。作者自述,ID Balancing 在更稀疏的路由下优势更明显,同时保持了有竞争力的语言建模与下游表现;但供稿文本中的关键实验数字缺失,因此这里不作量化比较。