Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.018 — 2026-07-22
NEWS 约 5 分钟

一张5090,Qwen长解码跑到543 tok/s

NInfer 把固定模型和显卡优化到极致:单张 RTX 5090 连续生成 65K Token,实测约 543 tok/s。

你让 AI 一口气写一本很长的书,短跑速度并不算数。它得连续写下去,还不能因为“草稿纸”越堆越厚而明显减速。NInfer 做的正是这样一次极限测试:把模型、权重和显卡全部固定,再从底层重写运行系统,看看单张 RTX 5090 能把长文本生成推到多快。

作者报告称,Qwen3.6-35B-A3B 在单请求下生成完整的 65,536 Token 时,平均解码速度达到 542.8±12.5 tok/s,也就是标题中的约 543 tok/s。Token 是模型处理文字的基本片段,tok/s 表示每秒生成多少个片段;解码则是模型逐个生成新 Token 的阶段。连续生成 65K Token,不只考验瞬时速度,也更容易暴露缓存和内存管理在长时间运行中的问题。

需要先说明信源边界:这些结果来自 NInfer 发布者本人在 Reddit 公布的测试,帖子、GitHub 代码和 Hugging Face 模型产物均属同一作者体系,目前没有独立交叉验证。

它为什么能这么快?

NInfer 不是常见的通用推理框架,而是一套从零编写的 C++/CUDA 推理引擎。推理引擎负责把模型计算高效地安排到硬件上;CUDA 是 NVIDIA GPU 的编程平台。作者把目标缩得很窄:只支持单张 RTX 5090,以及 Qwen3.6-27B、Qwen3.6-35B-A3B 两个精确的 checkpoint——也就是模型在特定训练节点保存下来的固定版本。

这像是为一辆车和一条赛道单独调校赛车,而不是造一辆谁都能开的家用车。作者称其优化覆盖自定义量化、权重排布、单个算子的 CUDA kernel、kernel fusion,以及专用的 LM-head draft path。量化可以理解为用更紧凑的数字格式保存模型权重,以减少存储和计算负担。按其自定义方案,两款公开模型产物分别为 16.29 GiB(约 5.03 bpw)和 20.84 GiB(约 4.97 bpw);bpw 表示平均每个权重使用多少比特。

Qwen3.6-35B-A3B 属于 MoE(Mixture of Experts,混合专家)模型:模型内部有多个“专家”子网络,每个 Token 只调用其中一部分。名称中的 A3B 通常表示每次推理实际激活的参数规模,而不是全部参数都会参与每一步计算。

543 tok/s 不是普通逐字生成

标题数字使用了 MTP——这组测试中的草稿式加速设置,并采用 draft window 3 和专门优化的 LM-head draft path。65,536-Token 测试的 MTP acceptance 为 73.0%。这里的 acceptance 可以看作草稿结果被模型接受的比例;比例越高,加速通常越容易发挥作用。

作者在一次预热后,用五个固定 seed 重复测试,并报告均值和样本标准差。约 55,171 Token 与约 8,675 Token 的长推理分别达到 572.9±9.1634.3±14.2 tok/s,对应 acceptance 为 77.7% 和 82.7%。这些数字显示,输出更长、接受率更低时,速度也有所下降。

任务类型的影响更明显。代码、翻译、故事和结构化输出分别得到 576.5、559.3、395.9 和 661.2 tok/s;对应 acceptance 从故事任务的 37.7% 到结构化输出的 87.2% 不等。换句话说,543 tok/s 不是所有内容都能稳定复现的统一速度。

不使用 MTP 时,差距更直观。面对 7,680、64,512 和 130,048 Token 的输入,普通解码速度分别为 271.1、242.9 和 219.4 tok/s;输入预处理阶段,也就是 prefill,速度分别为 15,544、10,809 和 7,828 tok/s。因此,543 tok/s 不能直接当作常规逐 Token 解码成绩来比较。

值得看的,是取舍本身

NInfer 的意义不在于证明所有 Qwen 模型都能在一张消费级显卡上达到同样速度,而在于展示:当模型、量化权重和硬件全部固定后,专用引擎还能从整个计算链条中挖出多少空间。代码与转换后的模型产物已经分别公开在 GitHub 和 Hugging Face,为后续复现提供了入口。

但这也是成绩的边界。它建立在单模型、单显卡、单请求和自定义权重之上,不能外推到原始权重、其他 Qwen 模型、其他显卡或常规部署环境。tok/s 也只衡量生成速度,不代表回答质量或同时服务多名用户的能力。

局限与未知

  • 供稿没有完整披露测试 prompt、采样参数、端到端延迟、功耗和显存占用,复现实验环境也不完整。
  • 自定义量化带来的精度与回答质量变化尚未给出,速度提升不能单独说明最终体验。
  • 更长上下文的数据在原帖中被截断,目前不能据此判断 130,048 Token 以上的表现。

供稿材料 SOURCES — 1

← 返回 2026-07-22 · 开源板块