让一张几年前的消费级显卡跑27B大模型,难点不只是“装得下”,还要答得快。开发者 iamMess 称,其面向 RTX 3090 的推理引擎可让单请求达到 82 tok/s——即模型每秒生成82个文本单位——64路并发持续吞吐为417 tok/s,帖子标题给出的峰值则是672 tok/s。这里的峰值吞吐是许多请求合计的产出,不能理解成每位用户都能获得672 tok/s。
这套方案通过 W4A16——把模型权重压成4位、计算仍用16位精度——将显存占用降至16.8GB;继续压缩部分组件后可到14.2GB,为 KV cache(模型生成时保存的中间结果)腾出更多空间。与此同时,另一位作者发布了约18GB的 Qwen3.8-27B INT4量化版,并保留可直接使用的 MTP:模型一次先猜多个后续 token,再逐一核验。作者自测称,在 RTX 5090 上,MTP把解码速度从59提升到124 tok/s,约增98%。两项工作并非同一实现,且3090引擎仍需给 vLLM 打补丁;但它们共同说明,围绕 Qwen3.8 27B 的消费卡适配仍在快速推进。