Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
PAPER H 1 约 1 分钟

MoE专家还没用,先把它搬来

轻量预测器提前搬运下一层可能用到的专家,让显存有限的设备少等数据。

像餐厅等客人点完菜才去仓库取食材,厨房再快,也会卡在搬运上。混合专家模型(MoE)也有类似问题:它包含许多分工不同的“专家”子网络,每次只调用少数几个;但显存放不下全部专家时,权重得临时从主机内存或存储搬回加速器,而要搬谁,通常要等路由器完成选择后才知道。

SpecPrefetch把这一步往前挪。它用轻量、逐层配置的适配器,预测下一层可能需要哪些专家,并异步预取;原有路由器仍负责最终选择,因此预测失误只影响效率,不改变模型输出。它还根据当前计算能掩盖多少传输时间来设定预取预算,避免为了提高命中率搬来过多专家,反而浪费带宽和显存。

作者在Qwen3-VL-30B-A3B和DeepSeek-VL2-Tiny上测试,并在Snapdragon 8 Elite设备的存储受限场景中报告:相比一个侧重计算优化的卸载运行时,解码吞吐量最高提升20%。代码和权重则计划在论文接收后发布。


供稿材料 SOURCES — 1

← 返回 2026-08-01 · 学术板块