Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
PAPER H 5 约 1 分钟

量化MoE开始按请求选实例

同一模型备好多种位宽副本,再按请求对量化损伤的敏感度动态分流。

同样把模型“压缩”得更狠,有些问题照样答得稳,有些却明显变差。Huang、Wu 和 Zhang 的工作抓住了这种差异:服务端预先放好 W2、W3、W4 等不同位宽的模型副本,再为每个请求挑一个。位宽越低,模型数字占用的二进制位越少,通常更省显存、更快,但质量风险也更高。这里的路由不是 MoE(Mixture-of-Experts,混合专家模型)内部挑专家,而是在同一基础模型的多个量化副本之间分流。

关键是先判断请求“怕不怕压缩”。作者提出 FWP(Fragility-Weighted Perplexity,脆弱度加权困惑度):先在参考副本上读取提示词,结合请求会用到哪些专家,以及这些专家受量化影响的程度,估计它在各位宽下的质量损失。随后,系统在每类请求允许的平均质量损失预算内,把耐受的请求送往更快的低位宽副本,把敏感请求留给高精度副本,并同时照顾各副本的处理容量。

论文在 88 个扩展 Qwen 请求上完整量化了 6,144 个专家块。作者称,按请求分配优于不看请求差异的混合方案;但原文抓取内容缺失了具体增益数字,且实验是离线模型化评估,并非真实在线、同等资源下的吞吐证明。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 学术板块