Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
PAPER H 35 约 1 分钟

MoE预填充搬上手机NPU

EStream让手机NPU按需加载MoE专家,以有限内存处理长提示

手机运行大模型,难处不只在“算不动”,还在“装不下”。混合专家模型(MoE)像医院分诊:每个词只交给少数“专家”处理,看似省计算;但读取一段长提示时,各词选中的专家合起来几乎覆盖全体。论文测得,512个Token(模型处理文字的基本单位)已会触及80.1%至98.1%的“层—专家”组合,到了4096个Token则升至92.4%至100%。这让负责神经网络计算、却偏爱固定流程的手机NPU同时遇到内存和动态调度难题。

EStream的关键做法是“专家虚拟化”:专家权重留在UFS闪存,需要时分组装入一块大小固定、NPU可直接访问的内存区域,用完便腾出;同时只编译一套通用专家计算图,在运行时绑定不同专家的权重和Token,不必补齐无用数据,也不用退回CPU或GPU。系统还让读取下一组权重与当前计算重叠,以隐藏存储等待。

作者在一台搭载Snapdragon 8 Elite Gen 5的OnePlus 15上测试称,EStream覆盖三种7B至16B MoE、最长4096 Token,相比各设置中最快基线将纯预填充首Token等待时间缩短至其1/2.25至1/27.57,峰值物理内存最多降至约1/12.29,并可扩展到46.7B参数模型。结果仍来自论文作者自测。


供稿材料 SOURCES — 1

← 返回 2026-09-12 · 学术板块