Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.032 — 2026-08-05
NEWS 约 1 分钟

Qwen3-Next补上MTP加速

llama.cpp为Qwen3-Next补上MTP适配,但加速效果仍因硬件而异。

IMAGE — r/LocalLLaMA 日榜

本地跑模型有时像逐字打字:每生成一个 token(模型处理文字的基本单位),都要再往前算一步。llama.cpp 的一项新 PR——提交给开源项目审查的代码改动——正为 Qwen3-Next 补上 MTP 支持。MTP 即“多 token 预测”,它会一次猜出多个后续 token,再验证哪些可以采用,从而有机会减少串行计算,让已有模型重新跑得更快。

这次适配的一个具体难点是,Qwen3-Next 的 Hugging Face 配置没有像 Qwen3.5 那样标明 MTP 层数。提交者因此改为从模型检查点里的 mtp.* 张量——保存模型参数的数据块——自动推算层数,并提供单独的 MTP GGUF 文件供测试。GGUF 是 llama.cpp 常用的本地模型文件格式。

不过,“支持 MTP”还不等于必然加速。提交者称 M5 的 Metal 环境获得了性能改善;另一名用户在双 R9700 的 Vulkan 环境中却报告速度最多下降约 50%,关闭 MTP 后恢复。现有材料中的性能表不完整,PR 也不等同于正式发布,因此更准确的结论是:Qwen3-Next 已有了补齐加速能力的路径,但不同硬件上的实际收益仍待验证。


供稿材料 SOURCES — 1

← 返回 2026-08-05 · 开源板块