手机跑大模型,难处不只是“聪不聪明”,还在于内存和耗电。Meta 的 MobileMoE 是一组面向端侧设备的 MoE(专家混合)语言模型:像把任务分给不同专科小组,每次只叫少数专家上场,从而以较低计算量保留更大的模型容量。
最具体的是 L 版:模型共有 53 亿参数,但处理每个输入时实际参与计算的约为 9.22 亿;它设置 60 个可调度专家,每个 token(模型处理文字的基本单位)只启用其中 4 个,另有 1 个专家始终工作。整个系列分 S、M、L 三档,激活参数分别为 3 亿、5 亿和 9 亿,总参数则为 13 亿、28 亿和 53 亿。材料称,各档采用 INT4 量化——用约 4 位整数保存权重——后体积均低于 3GB,以适配手机内存。
每档还提供 Base、监督微调 SFT 和量化感知训练 QAT 三种版本。它的看点,是把“模型装得下多少”与“每次真正算多少”拆开处理;不过目前材料只给出设计与规格,未披露手机实测速度、功耗或质量对比。