Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.052 — 2026-08-25
NEWS 约 1 分钟

GLM-4.5-Air在llama.cpp开启MTP

llama.cpp 为 GLM-4.5-Air 加入 MTP,用内存换取更快的本地生成。

IMAGE — r/LocalLLaMA 日榜

本地跑大模型时,常见的尴尬是:机器装得下模型,生成却仍要一个字一个字地等。如今,llama.cpp——消费级硬件常用的本地大模型推理引擎——已经可以为 GLM-4.5-Air 开启 MTP(Multi-Token Prediction,多 Token 预测)。它会提前提出多个后续 Token(模型生成文字时的基本单位)候选,再配合主模型验证;候选通过,就能减少逐个生成的串行等待。

GLM-4.5-Air 是一个总计 106B、每步仅激活 12B 参数的 MoE(Mixture of Experts,混合专家)模型。简单说,它像一间有许多专家的大机构,每次只请少数人处理任务:完整权重仍然吃内存,但单步计算量较低。因此,它尤其适合内存较充裕、算力相对有限的本地设备。提交者 jacek2023 称,开启 MTP 可获得“不错的提速”,并表示自己在 3090 上使用;如果现有 GGUF 模型文件没有包含 MTP 模块,还可另行下载一个小文件补上。不过供稿没有披露具体速度、接受率或硬件对比数据,实际收益仍要看设备与运行设置。


供稿材料 SOURCES — 1
01
you can now use MTP in GLM-Air r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-08-25 · 开源板块