本地跑大模型时,长提示词读得慢,未必只是模型太重,也可能是每次“喂”给芯片的文字不够多。Reddit 用户 bakawolf123 提醒 M5 Ultra 用户:可把 prefill step size 调到 8192。prefill 是模型回答前先读完提示、建立内部缓存的阶段;step size 则规定每批处理多少 token——也就是字、词片段或标点等基本单位。
作者用 GLM-flash-4bit 配合 MTP 测试:面对 32,768 token 的提示,步长从 2048 调到 8192 后,提示处理速度由每秒 860.489 token 升至 1056.033,生成速度也由 50.011 升至 72.722。这里的 MTP 会同时预测多个后续 token,并取回候选结果,因此分块大小可能同时影响读提示和后续生成。作者认为,块太小喂不满核心,太大又会增加调度;部分引擎如 omlx 可自适应调整,8192并非所有模型与引擎的通用最优值,但值得 M5 Ultra 用户立即做一次对照测试。