Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.043 — 2026-08-16
NEWS 11 信源 约 7 分钟

Qwen 3.8 27B:本地旗舰开跑

27B权重与量化包同步落地:从单卡5090到M4 Pro,本地部署首日实测来了。

IMAGE — r/LocalLLaMA 日榜

你想把一个能力较强的 AI 留在自己的电脑里,不把资料交给云端,也不按次付费。过去的问题是:模型即使号称“本地可跑”,究竟要多少显存、跑得多快、该下载哪个版本,往往要等发布后才知道。Qwen3.8-27B 如今进入了这个真正可检验的阶段:官方权重、社区量化包和多套推理引擎已经落地,首批用户也把不同硬件上的运行数据摆上了桌面。

这比单看模型榜单更有现实意义。本刊 8 月 4 日报道它时,“17GB 显存可运行”的说法还缺少量化格式、上下文长度和推理框架等条件。现在,我们终于可以把这些条件逐项补上。

先说明信源边界:发布与版本落地已有官方 Hugging Face 页面和多个社区来源交叉印证;下文的速度、显存与上下文数据,则都是特定作者在特定配置下的单次测试,只能视为首日路况,不能当成统一性能承诺。

从“有模型”到“能装起来”

Qwen3.8-27B 的“27B”,表示模型约有 270 亿个参数。官方 Hugging Face 页面已经提供 Qwen/Qwen3.8-27B,并另有 FP8 权重版本。开放权重意味着用户可以下载训练完成的模型参数,在自己的设备上运行;它不等于训练代码、数据和全部权利也一并开放。

真正降低本地使用门槛的,是社区几乎同步补齐了 GGUF、MLX 4-bit、MLX 8-bit 和 MTP 等版本。量化包,就是用较低数值精度处理过的权重文件,目的是减少存储和显存占用;代价是不同格式会在速度、占用和输出质量之间作不同取舍。

其中,Unsloth 已发布 GGUF 量化包,并给出 llama.cpp、Ollama 和 LM Studio 等本地工具的运行入口。推理引擎可以理解为模型的“播放器”:它负责把权重装进 CPU、GPU 或苹果芯片,再把回答生成出来。同一份模型换一个播放器,兼容性和速度都可能变化。因此,“27B 能不能跑”并不是一道只看显存容量的是非题,还要连同量化格式、上下文和引擎一起回答。

MTP 则是这些版本中反复出现的加速选项。它让系统尝试提前起草多个 token,再由模型检查是否接受。token 是模型处理文字的基本单位;tok/s 表示每秒生成多少个 token,可以粗略反映回答出现得多快,但不能说明回答是否更好。

单卡 5090 跑到约 200 tok/s,条件很重要

首日最醒目的数字来自 NInfer。该项目作者称,它已经提供 Qwen3.8-27B 的 Day-0 支持;在单张 RTX 5090 上配合 speculative decoding(推测解码,也就是先起草、再核验),生成速度约为 200 tok/s。作者还称其引擎可处理最多 8 个并发请求,并共享分页式 KV cache。KV cache 是模型阅读上下文时留下的中间结果,像一张草稿纸,可以避免每生成一个词都从头计算。

这个数字足以说明顶级消费级显卡可以把 27B 模型推到很流畅的生成速度,但不能脱离 NInfer、推测解码和作者的具体设置,改写成“Qwen3.8-27B 普遍能跑 200 tok/s”。目前材料也没有提供同条件下关闭加速后的对照,因此还无法判断其中多少来自模型,多少来自引擎优化。

更老的硬件也出现了可用案例。一名社区用户称,在 22GB RTX 2080 Ti 上运行 Unsloth 的 UD-Q4_K_XL 模型量化包,并把 KV cache 设为 q8_0 后,可以容纳 100k context——也就是约十万个 token 的上下文窗口;启用 MTP 后约为 40 tok/s。这里的 q8_0 指 KV cache 的量化,不是说模型本身采用 Q8 权重。这项测试把此前模糊的“多少显存能跑”变成了较完整的配置描述,不过它仍是单一用户报告。

双 RTX 3090 的一次 OpenCode 编程任务则展示了长任务中的速度波动。测试使用 Q8_K_XL,模型各轮生成速度约为 39.58 至 77.38 t/s;最初一轮生成了 19,361 个 token,速度为 40.89 t/s。作者用一个提示启动任务,但记录显示代理随后经历了许多轮交互,因此不能把它理解成模型一次生成就完成了整个项目。

苹果芯片的重点不是“能跑”,而是怎么加速

在 M4 Pro 48GB 上,mlx-dspark 作者报告,Qwen3.8-27B 的 8-bit 推理从 8.3 tok/s 提升到 20.3 tok/s,平均加速 2.45 倍,峰值内存约 29GB。标题所说的“最高约 3 倍”来自特定数学任务,并非所有任务都稳定达到这个幅度。

同一测试中,4-bit 版本达到 25.3 tok/s,报告加速 1.74 倍,内存约 18GB。作者还称,加速后的 8-bit 版本比未加速的 4-bit 版本更快。其核验方式是让目标模型逐个检查草稿 token,并比较加速前后的 token ID 是否一致。即便如此,这些结果仍只覆盖一台 M4 Pro 48GB、指定任务和三次测试中位数,不能直接外推到所有苹果芯片。

这组数据真正有意思的地方,不是“Mac 也能运行 27B”,而是本地部署开始出现清晰的选择题:4-bit 更省内存,8-bit 占用更高;推测解码可能让较高精度版本追回速度。用户可以按自己的内存、速度需求和质量偏好取舍,而不必只问一个笼统的“跑不跑得动”。

为什么这次发布值得看

首先,生态交付速度已经成为模型发布的一部分。官方权重出现后,GGUF、MLX、MTP 版本以及 llama.cpp、Ollama、LM Studio、NInfer 等运行路径迅速就位。对普通用户而言,这些配套决定了模型是一个网页上的名字,还是当天就能装进电脑的工具。

其次,首日数据修正了“显存数字决定一切”的直觉。同为 Qwen3.8-27B,22GB 显卡上的 4-bit 模型、48GB Mac 上的 8-bit 模型,以及双 3090 上的 Q8 模型,面对的是完全不同的占用和速度。上下文越长,KV cache 也越占空间;是否启用 MTP、采用哪种引擎,同样会改变结果。

最后,一名社区作者比较配置文件后称,Qwen3.8-27B 与 Qwen3.6-27B 的架构配置 diff 为零。这只能说明公开配置层面没有差异,不能据此排除权重、训练数据、后训练流程或未展示实现细节的变化,也不足以证明能力变化全部来自训练改进。官方页面已经发布基准测试成绩,社区也做了图表,但现有文字材料没有提供可可靠摘录的具体分数,因此这里不作能力排名。

局限与未知

  • 所有速度与内存结果都是单一作者在特定硬件、量化、上下文和引擎下的测试,尚缺统一设置下的横向复现。
  • 一名用户观察到 reasoning_effortmedium 调到 xhigh 后,思考量从数千 token 增至至少 15k—20k,Pac-Man 示例约 40k;作者本人也怀疑配置或实现异常,目前不能视为稳定行为。
  • 现有材料没有给出可核验的官方基准分数,也没有系统比较各种量化格式的输出质量。首日体检回答了“怎样跑起来”,还没有回答“哪种配置最值得长期使用”。

供稿材料 SOURCES — 11

← 返回 2026-08-16 · 开源板块