本地跑大模型时,常见的尴尬是:机器装得下模型,生成却仍要一个字一个字地等。如今,llama.cpp——消费级硬件常用的本地大模型推理引擎——已经可以为 GLM-4.5-Air 开启 MTP(Multi-Token Prediction,多 Token 预测)。它会提前提出多个后续 Token(模型生成文字时的基本单位)候选,再配合主模型验证;候选通过,就能减少逐个生成的串行等待。
GLM-4.5-Air 是一个总计 106B、每步仅激活 12B 参数的 MoE(Mixture of Experts,混合专家)模型。简单说,它像一间有许多专家的大机构,每次只请少数人处理任务:完整权重仍然吃内存,但单步计算量较低。因此,它尤其适合内存较充裕、算力相对有限的本地设备。提交者 jacek2023 称,开启 MTP 可获得“不错的提速”,并表示自己在 3090 上使用;如果现有 GGUF 模型文件没有包含 MTP 模块,还可另行下载一个小文件补上。不过供稿没有披露具体速度、接受率或硬件对比数据,实际收益仍要看设备与运行设置。