你有一张12GB显存的显卡,却想在本地运行一个125B级模型,就像要把一间仓库的货塞进家用冰箱。办法不是把货物全部压进冰箱,而是只把眼下要用的部分放进去,其余留在系统内存,甚至临时从SSD读取。两份玩家实测表明,Qwen3.8-Flash-Next确实能在这类消费级机器上开口说话。但标题里的“12GB能跑”不等于模型完整装进12GB显存;真正值得看的,是显存、内存、SSD和速度之间怎样互相交换。
本文数据来自两名用户的单机实测。两套机器、模型版本和装载方式不同,速度不能直接横向比较。
12GB只是显卡这一栏
第一名实测者 carteakey 使用 RTX 4070 12GB、64GB DDR5-5600系统内存和Gen4 NVMe SSD,在Linux上运行Qwen3.8-Flash-Next。这个模型标为125B-A6B MoE,并带有51B n-gram table。
MoE,即“混合专家”模型,可以理解为模型内部有许多分工不同的模块,每次生成只调用其中一部分。它因此能以较低的激活计算量承载很大的总参数规模。n-gram table则是一张用于查表的记忆数据。问题在于,少算不等于少存:模型数据依然很大。
这套方案使用AtomicChat的4.27 bpw量化。量化就是用更低精度保存权重,以缩小模型体积;压得越狠,越需要权衡输出质量、速度和兼容性。装不进显存的数据则通过n-gram SSD lazy-mode offloading处理,也就是把部分数据卸载到NVMe SSD,需要时再读取。--fit on --fit-target 512用于自动选择适合当前资源的参数。
所以,12GB显存只是入场条件之一。64GB系统内存和高速SSD同样是方案的一部分。显存是GPU直接使用的高速内存,系统内存主要由CPU使用;数据跨设备搬运时,速度通常会下降。NVMe SSD虽然比普通硬盘快,仍明显慢于内存。
从6个token到约20个token
在这台机器上,最初的生成速度约为每秒6个token。token是模型处理文字时使用的小单位,不完全等同于一个汉字或单词。应用新版MoE改进后,速度升至19.35 tok/s。
实测者随后采用尚未合并的llama.cpp PR #28243,并加载1.78GB的shared-Q4_K_M compact MTP head,再配合-ncmoe 45,测得20.65 tok/s。MTP acceptance为77%至96%。不过作者也指出,12GB显存下必须腾出部分空间容纳这个额外模块,因此收益并不算大;在他的测试里,只有shared与Q4_K_M组合带来有利提升。
这个数字很亮眼,但条件也很具体:特定量化文件、开发中的补丁、紧凑MTP头和一组参数缺一不可。它更像一份极限调校记录,而不是下载模型后默认就能得到的速度。
16GB方案揭开了另一面
第二名用户 ironicstatistic 使用RTX 5060 Ti 16GB、约30GB可见系统内存和8GB zram。zram是在内存中建立的压缩交换空间,用CPU开销换取更多可用容量。这套机器仍无法运行其尝试的普通量化版本,只能改用约68.95GB的REAP版本,把专家数量裁至320个。
即便如此,显存、内存和zram合计也只有约44.5GB,仍放不下全部数据。开启mmap后,程序依赖SSD和操作系统页缓存按需读取,速度只剩约2 tok/s。mmap可以让程序不必把整个文件一次装入内存,但频繁访问SSD会把存储带宽变成瓶颈。
这与12GB方案接近20 tok/s并不矛盾。前者内存更少,使用了裁剪模型和不同的装载方式;后者有64GB高速内存,只把特定数据延迟卸载到SSD。两者共同证明的是“资源受限时仍可能运行”,不是“显存越小也能保持同样速度”。
真正的进展是重新分配成本
我们在8月29日介绍这款模型时,具体速度和量化稳定性仍待测试。现在至少出现了两种可操作路径:内存充足时,可以把GPU当作高速工作台,把其余数据留在RAM或SSD;内存不足时,则需要更激进的量化、裁剪和分页读取,但速度可能降到约2 tok/s。
这类实验改变的不是模型大小,而是成本落在哪里。你可以少买显存,却要补上更多系统内存、更快的SSD,以及调试补丁和参数的时间。“能运行”与“完整驻留显存”是两项不同纪录;前者如今可以在12GB至16GB显卡上实现,后者并没有因此变成12GB。
局限与未知
- 20.65 tok/s来自单一用户测试,并依赖尚未合并的PR,正式版本的兼容性与复现性仍不确定。
- 12GB与16GB两套实测使用不同硬件、模型变体和装载方式,不能据此判断哪种方案普遍更快。
- carteakey称该模型在多数任务上超过Qwen3.8 27B dense,但没有给出基准细节;另一名用户也尚未完成对应benchmark,因此这一判断目前不能视为已被验证。