Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER H 26 约 1 分钟

MoE推理开始为Prefill和Decode分别剪枝

SlimWise让MoE预填充保留完整模型、解码单独剪枝,用分阶段取舍换取更高吞吐。

一桌厨师接到一批订单,备菜时人手越全越好;真正逐盘出菜时,却可能把时间耗在来回找厨师上。MoE(混合专家模型)也有类似问题:它为每个词挑少数“专家”子网络,但批量生成时,一轮仍可能触及几乎全部专家,搬运权重反而成了瓶颈。

SlimWise不再用同一套剪枝规则贯穿推理。Prefill——一次读完输入并建立缓存——保留完整模型,因为这一阶段主要受计算能力限制,论文实验中剪枝后的吞吐量没有稳定提升。Decode——随后逐词生成——则裁掉部分专家,减少权重搬运,并直接沿用完整模型生成的KV Cache,也就是模型为避免重复计算而保存的中间结果,无需转换。

作者在Qwen3.6-35B-A3B上的结果显示,剪掉50%的专家后,解码吞吐量最高提升至完整模型的1.81倍,同时仅有很小的准确率损失。论文也提醒,准确率可能掩盖回答变得过短或过长的问题,因此又加入轻量蒸馏来校正生成行为。值得注意的不是“剪得更多”,而是承认推理的两个阶段根本不是同一种负载。


供稿材料 SOURCES — 1

← 返回 2026-10-03 · 学术板块