一台只有 48GB 统一内存的 Mac,按常规办法装不下 104GB 的模型权重。slotstream 的思路像是边做菜边从储藏室取料:把 Qwen3.8-Flash-Next——一个 1250 亿参数的混合专家模型——以 4-bit 形式留在 SSD,需要哪部分再读入内存,而不是一次全部加载。
项目作者称,在 48GB M5 Pro 上,实测峰值内存约 32GB,热启动后的生成速度约为每秒 12 个 token(模型生成文字时处理的基本单位);引擎启动约 2 秒,因为起初只加载 3.8GB 的主干。它还兼容 Ollama 和 OpenAI 的聊天 API——也就是常见客户端所用的调用接口,通常换个服务地址就能接入。
这展示了分层卸载的实际价值:消费级机器也能尝试远大于内存容量的模型。代价是 SSD 容量与读取速度会成为瓶颈;项目要求约 110GB 空闲磁盘。其余内存档位的速度只是工具估算,并非真机实测。