Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.075 — 2026-09-17
NEWS 约 1 分钟

SSD流式MoE再提速一成

提前猜出下一批专家,低内存 Mac 上的 MoE 流式运行再快一成

在小内存 Mac 上跑大模型,常见瓶颈不是“算不动”,而是“搬得慢”:MoE(混合专家模型)虽每次只调用少数参数模块,却仍要把大量专家权重存进 SSD,需要时再读入内存。就像后厨等订单来了才去仓库取食材,计算过程常被存储延迟卡住。

开发者 carloslfu 为 slotstream 实现了 expert lookahead:在当前计算进行时,用 Qwen 的路由器——负责决定每个 token 交给哪些专家的小型网络——根据当前隐藏状态预测两层之后可能需要的专家,并提前加载。作者称,这让采用专家卸载和 SSD 流式加载的 Qwen 3.8 flash 在已有多项优化之上再提速超过 10%。

有意思的是,作者起初训练了一个小模型做预测,反复实验后却发现,模型自身就是更好的预测器,最终把前瞻距离定为两层;另加的小型纠正模型据称还能带来约 3%—4% 提升。上述结果来自作者在 Reddit 的自述,材料未披露完整测试配置与可复现实验数据,因此更适合看作一项实用的工程进展,而非普遍性能结论。


供稿材料 SOURCES — 1

← 返回 2026-09-17 · 开源板块