大模型装不进普通电脑,往往不只是因为“太聪明”,而是每次计算都要搬动太多参数。Maple 走了一条更省的路线:它共有约 200 亿参数,但采用 MoE(专家混合)结构,处理每个 token——模型读写文字的基本单位——时只调用约 10 亿参数;同时把部分权重压成三值。现在,一项 llama.cpp 的 PR 正在为这套 20B-A1B 架构补上 CPU 加载与计算支持,让没有专用显卡的电脑也有机会运行它。
提交者称,官方 DeepGrove GGUF——把模型权重和运行元数据打包在一起的本地推理文件——已能在 CPU 上正确加载和生成。在 Apple M4 测试中,TQ2_0 文件的提示词处理速度为每秒 216 token,生成速度为每秒 88 token。完整 WikiText-2 测试还显示,TQ1_0 与 TQ2_0 的困惑度相同;两者保存的是同一套三值权重,只是打包方式不同。值得留意的是,这仍是一项处于评审中的适配工作,实际速度和效果还会受硬件、上下文长度及推理实现影响。