在笔记本上常驻一个本地 AI,最现实的麻烦往往不是“能不能跑”,而是它会不会挤占其他应用的内存。Reddit 用户 netikas 将 Maple-Preview 加入 Mference 后称,在 MacBook Air M4 上测得约 500MB RAM 占用和 40 tok/s 的生成速度。RAM 占用指运行时实际驻留内存;tok/s 则是模型每秒生成的 token 数,可粗略理解为出字速度。
这个结果值得留意,因为它指向一种更轻的端侧设计:让小模型负责理解意图和推理,再把事实搜索、计算或设备操作交给外部工具,以工具依赖换取更低的常驻内存。Apple Silicon 的 CPU 和 GPU 共享统一内存,本地模型仍会与系统及其他应用争用容量,500MB 因而尤其醒目。不过,这只是作者披露的早期单机实测;材料未给出完整测试设置、任务质量和重复实验,40 tok/s 也不能脱离上下文长度、分词方式与硬件配置直接横向比较。