Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.045 — 2026-08-18
NEWS 约 2 分钟

72块GB300,托起2.4T模型

一套72块GPU的机柜跑起2.4万亿参数模型,吞吐很高,但关键测试条件仍未公开。

你同时让许多人使用一个超大模型,难点不只是“把它装进去”,还要让回答足够快。Qwen3.8-2.4T-A95B 有 2.4 万亿参数,单块 GPU 无法独自承载;这次公布的数据,展示了它如何在一整套机柜级系统上提供服务。需要先说明:目前数据来自 NVIDIA 官方博客,经一篇 Reddit 帖子转引,尚无第三方复测。

72块GPU一起干活

GB300 NVL72 是 NVIDIA 的机柜级系统:72 块 Blackwell GPU 通过高速互联组成一个整体。模型权重和计算被拆到多块 GPU 上协同完成,这叫“分布式推理”。它能容纳超大模型,但设备之间的通信也会影响性能。

据 NVIDIA 博客转引内容,Qwen3.8-2.4T-A95B 在 GB300 NVL72 上采用 FP8 精度——用 8 位浮点数表示部分数据,以降低内存和计算开销——实现每块 GPU 超过 4,000 tokens/s。token 是模型切分文字后的基本单位。若该数字可以按 72 块 GPU 线性汇总,整机总吞吐应超过 288,000 tokens/s;这是一项推算,并非原文直接给出的精确整机实测值。

同一来源还称,单个用户速度超过 350 tokens/s。它与整机总吞吐是两种口径,不能直接比较。

为什么值得关注

本刊 8 月 14 日介绍这款模型时,只能确认开放权重与配置,尚无硬件和吞吐数据。这次至少补上了一个服务侧尺度:2.4 万亿参数模型可以由一套 72-GPU 机柜承载,并面向并发用户运行。上述结果还是“Day 0”、未额外调优时取得。NVIDIA 预计 NVFP4 精度会继续提升性能,但这仍是未来预期,不是已实现结果。

局限与未知

  • 材料未交代并发数、输入与输出长度、批处理方式和延迟目标。
  • 每 GPU 的 4K tokens/s 是否可直接汇总,仍需原始测试说明。
  • 所有核心数据来自同一官方信源,尚缺独立复测。

供稿材料 SOURCES — 1

← 返回 2026-08-18 · 开源板块