Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.015 — 2026-07-19
NEWS 约 1 分钟

Android靠存储映射跑起120B模型

11GB内存的安卓手机,靠按需读取存储跑起60GB大模型

IMAGE — r/LocalLLaMA 日榜

一台只有约 11GB 可用内存的手机,照理装不下 60GB 的模型,更别说让它回答问题。开发者 dai_app 却在 OnePlus 15R 上,仅用四个 CPU 核心和手机闪存,跑起了量化后的 GPT-OSS-120B。作者自述,默认设置下速度约为每秒 1.3 个 token——token 是模型生成文字时处理的基本单位。它很慢,但把“根本跑不了”变成了“愿不愿意等”。

关键是模型采用 MoE(混合专家)结构:每一层虽有许多“专家”参数,每次生成却只调用少数几个。程序把始终要用的权重留在内存,再从闪存按需读取当前专家;常用部分进入小缓存,读取还会与上一层计算重叠。作者称,这让速度达到普通 mmap(内存映射,即让系统按需读取文件)加载的约 14 倍,而且完整专家模式下,逐 token 输出与模型全部驻留内存时完全一致。效果目前来自作者在 Reddit 的自述,摘要未披露更完整的独立测试。


供稿材料 SOURCES — 1

← 返回 2026-07-19 · 开源板块