在 Mac 上跑本地 AI,常见瓶颈不是模型不会答,而是逐字生成太慢。MTPLX 提供原生应用和 CLI(命令行界面),让模型一次尝试多个 token——也就是组成文字的基本单位——再成批核验,从而减少等待。它基于 MLX——面向 Apple silicon 的机器学习框架——运行,面向 M1 及更新芯片和 macOS 14 以上系统。
它利用 Qwen 3.5、3.6、3.8 自带但少有运行时启用的 MTP(多 token 预测)结构,让同一个模型先给自己打出一小段“草稿”。因此不需要另载一个草稿模型占用内存。项目作者称,候选经精确拒绝采样和修正后,输出概率分布与普通解码一致;实测在 16 GB M4 Mac mini 上提速 1.6 倍,在 M5 Max 上达到 2.24 倍。其中 9B 模型在前者上从每秒 14.4 token 提升至 23.0 token。应用还会按具体芯片、内存带宽和散热逐档测速;如果 MTP 没有胜过普通解码,就不会启用。需要留意的是,标题所说的“约三倍”并无供稿数字支持,目前可确认的最高数据是作者自述的 2.24 倍。