你同时让许多人使用一个超大模型,难点不只是“把它装进去”,还要让回答足够快。Qwen3.8-2.4T-A95B 有 2.4 万亿参数,单块 GPU 无法独自承载;这次公布的数据,展示了它如何在一整套机柜级系统上提供服务。需要先说明:目前数据来自 NVIDIA 官方博客,经一篇 Reddit 帖子转引,尚无第三方复测。
72块GPU一起干活
GB300 NVL72 是 NVIDIA 的机柜级系统:72 块 Blackwell GPU 通过高速互联组成一个整体。模型权重和计算被拆到多块 GPU 上协同完成,这叫“分布式推理”。它能容纳超大模型,但设备之间的通信也会影响性能。
据 NVIDIA 博客转引内容,Qwen3.8-2.4T-A95B 在 GB300 NVL72 上采用 FP8 精度——用 8 位浮点数表示部分数据,以降低内存和计算开销——实现每块 GPU 超过 4,000 tokens/s。token 是模型切分文字后的基本单位。若该数字可以按 72 块 GPU 线性汇总,整机总吞吐应超过 288,000 tokens/s;这是一项推算,并非原文直接给出的精确整机实测值。
同一来源还称,单个用户速度超过 350 tokens/s。它与整机总吞吐是两种口径,不能直接比较。
为什么值得关注
本刊 8 月 14 日介绍这款模型时,只能确认开放权重与配置,尚无硬件和吞吐数据。这次至少补上了一个服务侧尺度:2.4 万亿参数模型可以由一套 72-GPU 机柜承载,并面向并发用户运行。上述结果还是“Day 0”、未额外调优时取得。NVIDIA 预计 NVFP4 精度会继续提升性能,但这仍是未来预期,不是已实现结果。
局限与未知
- 材料未交代并发数、输入与输出长度、批处理方式和延迟目标。
- 每 GPU 的 4K tokens/s 是否可直接汇总,仍需原始测试说明。
- 所有核心数据来自同一官方信源,尚缺独立复测。