Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.045 — 2026-08-18
NEWS 2 信源 约 1 分钟

3090把27B模型推到672 tok/s

RTX 3090单请求82 tok/s、峰值672 tok/s,另一套18GB量化方案让MTP可直接启用。

IMAGE — r/LocalLLaMA 日榜

让一张几年前的消费级显卡跑27B大模型,难点不只是“装得下”,还要答得快。开发者 iamMess 称,其面向 RTX 3090 的推理引擎可让单请求达到 82 tok/s——即模型每秒生成82个文本单位——64路并发持续吞吐为417 tok/s,帖子标题给出的峰值则是672 tok/s。这里的峰值吞吐是许多请求合计的产出,不能理解成每位用户都能获得672 tok/s。

这套方案通过 W4A16——把模型权重压成4位、计算仍用16位精度——将显存占用降至16.8GB;继续压缩部分组件后可到14.2GB,为 KV cache(模型生成时保存的中间结果)腾出更多空间。与此同时,另一位作者发布了约18GB的 Qwen3.8-27B INT4量化版,并保留可直接使用的 MTP:模型一次先猜多个后续 token,再逐一核验。作者自测称,在 RTX 5090 上,MTP把解码速度从59提升到124 tok/s,约增98%。两项工作并非同一实现,且3090引擎仍需给 vLLM 打补丁;但它们共同说明,围绕 Qwen3.8 27B 的消费卡适配仍在快速推进。


供稿材料 SOURCES — 2

← 返回 2026-08-18 · 开源板块