一台只有约 11GB 可用内存的手机,照理装不下 60GB 的模型,更别说让它回答问题。开发者 dai_app 却在 OnePlus 15R 上,仅用四个 CPU 核心和手机闪存,跑起了量化后的 GPT-OSS-120B。作者自述,默认设置下速度约为每秒 1.3 个 token——token 是模型生成文字时处理的基本单位。它很慢,但把“根本跑不了”变成了“愿不愿意等”。
关键是模型采用 MoE(混合专家)结构:每一层虽有许多“专家”参数,每次生成却只调用少数几个。程序把始终要用的权重留在内存,再从闪存按需读取当前专家;常用部分进入小缓存,读取还会与上一层计算重叠。作者称,这让速度达到普通 mmap(内存映射,即让系统按需读取文件)加载的约 14 倍,而且完整专家模式下,逐 token 输出与模型全部驻留内存时完全一致。效果目前来自作者在 Reddit 的自述,摘要未披露更完整的独立测试。