Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.057 — 2026-08-30
NEWS 2 信源 约 6 分钟

Rubin首测:算力竞赛转向系统战

Rubin首测最高提升DeepSeek吞吐30倍:关键不只换GPU,而是让整座数据中心协同起来。

IMAGE — TechCrunch · AI

你让 AI 替你研究一家公司,它不会只回答一次。它要读材料、调用工具、执行代码,再把前面的结果带进下一轮推理。整个过程像一支不断交换文件的团队:干活的人再快,如果资料送不到、任务排不开,大家仍会等着。NVIDIA 此次公布 Vera Rubin NVL72 的系统级测试,想解决的正是这个问题——提升的不只是一颗 GPU,而是整座机架处理复杂 AI 任务的效率。

本刊 8 月 22 日曾报道,OpenAI 首批 Vera Rubin 机架已经到货并运行训练栈,但当时还不能判断正式投产时间和性能增幅。本期出现了第一组系统级数据。不过,核心跑分目前主要来自 NVIDIA 发布口径经媒体转述,完整测试设置尚未公开,以下“30 倍”“35 倍”等数字都应理解为特定条件下的最高值。

这次比的不是单张显卡

Vera Rubin NVL72 是面向 AI 数据中心的机架级平台。它把 Rubin GPU、Vera CPU、Groq 3 LPX 推理加速器,以及存储和网络组件放进同一套系统协同运行。换句话说,这次比较的不是两张显卡谁更快,而是两座“小型计算工厂”谁能在相同电力下完成更多工作。

据智源社区转述的 NVIDIA 测试,在 AgentX 智能体编码工作负载中运行 DeepSeek-V4-Pro(1.6T)时,Vera Rubin NVL72 的每兆瓦吞吐量最高达到 GB300 NVL72 的 30 倍,每百万 Token 成本最高降低 35 倍。

Token 是模型处理文字时使用的基本单位;吞吐量指系统在一段时间内能处理多少 Token 或任务。“每兆瓦吞吐量”又把处理能力除以耗电规模。数据中心常被供电能力卡住,因此这个指标比单颗芯片的理论峰值更接近运营问题:同样一兆瓦电,究竟能服务多少 AI 请求。

但这不是“任何模型都快 30 倍”。吞吐会随模型、数值精度、上下文长度、批量、功耗预算和软件栈变化。现有材料没有完整披露这些测试条件,也没有提供独立复测。

GPU 很快,数据也得送得上

系统战的关键之一是 Vera CPU。CPU 在这里更像调度中心:它负责把数据从存储送入内存,再及时交给 GPU。GPU 即使计算很快,也可能因为等待数据而闲置。

TechCrunch 采访的 NVIDIA 存储技术副总裁 Jason Hardy 表示,Vera CPU 在相关数据操作中带来最高约 3 倍改善,使闪存性能不再轻易受数据搬运瓶颈限制。两份材料共同指向同一个变化:当计算规模扩大,竞争焦点开始从“芯片算得多快”转向“整套系统能否持续喂饱芯片”。

据智源社区转述,NVIDIA 的 DSX MaxLPS 还会在 GPU、机架和工作负载层面管理电力,使相同兆瓦预算内最多可配置 40% 更多 GPU。这同样是厂商公布的最高值,材料没有给出适用条件。

一个管调度,一个管快速输出

另一块拼图是 Groq 3 LPX。它是 Vera Rubin 平台中的低延迟推理扩展,负责加速 Token 生成。可以把一次推理粗略理解为先“读懂大量材料”,再逐字“写出答案”:Rubin GPU 处理大规模上下文,Groq 3 LPX 集中处理快速输出,两类硬件各做更擅长的部分。

这种分工对 Agent 工作负载尤其重要。Agent 不是单轮聊天,而是为了完成目标反复调用模型、工具和代码环境的一连串任务。智源社区援引 OpenRouter 数据称,一个 Agent AI 任务消耗的 Token 数是普通聊天对话的 15 倍。任务链越长,内存、网络与调度中的等待越容易累积。

据同一来源转述,Groq 3 LPX 在 10 万 Token 上下文下运行 Gemma 4 31B,输出达到每秒 3,400 Token;编码任务的最高输出速度为每秒 6,981 Token。不过,相关模型名称、基准设置与结果目前缺少材料中的一手报告佐证,不能直接外推到其他模型和任务。

为什么值得关注

Rubin 首测真正值得看的,不是一个孤立的“30 倍”,而是 NVIDIA 正在改变竞争单位。过去,云厂商自研 GPU 会直接冲击它的核心优势;现在,门槛扩展到了 CPU、内存、网络、存储、电力管理和推理加速器之间的配合。

这也解释了为什么 Agent 会成为新的测试场景。单轮问答主要考察模型完成一次请求的速度;Agent 则不断增长上下文、调用工具并生成后续步骤,更容易暴露数据搬运和系统调度的问题。谁能减少这些等待,谁就可能在不单纯堆叠计算芯片的情况下,提高整座数据中心的实际产出。

当然,系统级竞争并不自动意味着 NVIDIA 已经获胜。它只是把战场从单颗 GPU 推到了更复杂的一层:竞争者不仅要造出加速芯片,还要让整套基础设施稳定、高效地协同工作。

局限与未知

  • 30 倍吞吐、35 倍成本下降和多配置 40% GPU 均为 NVIDIA 口径经单一材料转述的“最高”结果;模型精度、批量、上下文、功耗预算及完整软硬件配置尚未披露。
  • 材料对 GB300 相比 H200 的吞吐提升同时出现“最高 30 倍”和“15 倍”两种说法,因此不能据此推导“两年提升 900 倍”。
  • 第六代 NVLink 的网络比较、Groq 3 LPX 的量产与客户部署,以及所谓“SpaceXAI”太空部署等说法缺少足够清晰的独立证据,本篇不据此下结论。

供稿材料 SOURCES — 2

← 返回 2026-08-30 · 科技板块