在 Mac 上把 30B 大模型跑起来,只解决了“装得下”;真正影响体验的,是回答能不能更快。开发者 A-Rahim 近日为 Muse Glimmer 30B 接入 mlx-dspark,让它在 Apple Silicon 上使用投机解码——先由小型草稿模型提出一批 token(模型生成文字的基本单位),再交给目标模型统一核验,像先打草稿、后逐项签字。
据作者在 Reddit 自述,其 M4 Pro 上的 8-bit 模型从每秒 8.2 token 提升到 18—26 token:数学内容最快,达到 3.27 倍;代码为 2.5 倍,聊天为 2.22 倍。因为每个 token 最终都由目标模型确认,作者称输出与普通解码逐字节一致。代价是内存:8-bit 运行峰值约 40GB,建议使用 48GB Mac;4-bit 版本约需 18GB,速度约每秒 25 token,提速约 1.7 倍。这些结果目前来自作者单机测试,不同 M 系列芯片上的表现仍待验证。