Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
NEWS 约 1 分钟

35B MoE塞进小米手机

12GB 小米手机跑起 35B MoE,代价是不断从存储调取专家权重

IMAGE — r/LocalLLaMA 日榜

把 35B 大模型装进只有 12GB 内存的手机,好比让一支大团队挤进小办公室:办法不是让所有人同时进场,而是需要谁就临时叫谁。Reddit 用户 Aromatic_Ad_7557 借助 BigMoeOnEdge,在改装的小米 12 Pro“Zeus”上成功运行 Qwen 3.6 35B MoE。MoE 是“混合专家”模型,每次生成只调用部分专家子网络,因此 35B 总参数不必始终全部驻留内存。

原帖最有信息量的数字,是专家缓存常驻约 2998.5 MiB,命中率 70.8%;每生成一个 token(模型处理文字的基本单位),仍需从闪存读取约 136.35 MiB 数据。最终实测生成速度为每秒 2.428 token,模型加载耗时 14.421 秒。换句话说,它用频繁搬运专家权重换来了更低的内存占用,但存储读写也成了明显瓶颈。

受内存限制,目前上下文窗口——模型一次能记住的输入与对话范围——最多为 8192 token;图像转文字能力尚未测试。以上结果来自作者自述及其实时录像,尚无独立核查,但它清楚展示了按需加载正在把端侧大模型的边界往前推。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 开源板块