Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.035 — 2026-08-08
NEWS 约 1 分钟

MoE卸载调参让预填充翻倍

把八层 MoE 专家权重留给 CPU,3090 腾出显存扩大批次,提示词吞吐升至 2.36 倍。

显卡像一张工作台:工具全堆在桌上,反而没有地方摊开更多材料。这次调优做了件反直觉的事——把八层 MoE(每次只调用部分“专家”的模型结构)专家权重留在 CPU,腾出 RTX 3090 的 24GB 显存,用来扩大同时处理的提示词批次。

据作者 Longjumping-Music638 自测,在 Qwen3.6-35B-A3B Q6、按 64K 上下文容量配置的环境中,批次从 512 增至 1024,微批次从 128 增至 512。处理 4K 提示词时,预填充——模型一次读完整段输入的阶段——从 564.5 升至 1330.0 token/s,达到 2.36 倍;解码,也就是逐个生成新 token,速度则基本不变。关键不是“CPU 计算更快”,而是卸载释放了显存,让更适合并行的预填充阶段能吃下更大批次。作者也强调,这是卸载与批次调参共同产生的结果,且并非 64K 深度下的吞吐测试。


供稿材料 SOURCES — 1

← 返回 2026-08-08 · 开源板块