Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.028 — 2026-08-01
NEWS 约 4 分钟

Rubin登场:英伟达开始卷电网

Rubin把竞争从GPU推到整座机架,目标不再是跑得最快,而是让每度电生成更多Token。

IMAGE — InfoQ 中文

你经营一座 AI 数据中心,最先撞上的未必是芯片不够快,而是电不够用。机房能接入的电力有限,散热也有上限。此时,单颗 GPU 的峰值性能再高,也不如“同样一兆瓦能生成多少内容”来得实际。NVIDIA 新一代 Vera Rubin 平台瞄准的正是这个问题:把 CPU、GPU、网络、供电和冷却一起设计,争取压低每一个 Token——模型处理或生成的文字单位——所摊到的成本。

本文数据均来自 InfoQ 对 NVIDIA 及合作伙伴披露信息的整理,尚无独立复测。尤其是“10 倍”等结果,只适用于材料所述测试和指标,不能直接外推到所有模型与部署环境。

竞争单位变成整座机架

Vera Rubin 不只是一款 GPU,而是一套覆盖 CPU、GPU、网络与机架系统的平台。所谓机架级系统,就是把数十颗计算芯片、交换设备、电源和冷却当成一个整体设计,而不是分别采购后再拼装。

据 InfoQ 报道,这套平台由七款芯片和五种机架系统协同设计。Vera Rubin NVL72 已进入量产加速阶段,CoreWeave、Google Cloud、Microsoft Azure 和 Oracle Cloud Infrastructure 的相关机架已投入运行;其供应链覆盖 30 个国家、350 多家工厂。

这样做的好处是减少组件之间互相等待。Vera CPU 的 Olympus 核心、连接机架内芯片的第六代 NVLink,以及连接更多机架的 Spectrum-X 网络,都围绕同一套系统配合。不过代价也很明确:客户采用的不是一块可自由替换的芯片,而是对整套 NVIDIA 平台产生更深依赖。

真正要卷的是每一兆瓦

Rubin 最值得关注的变化,不是又公布了一个峰值性能数字,而是把衡量目标换成“每兆瓦每秒 Token 吞吐量”。它回答的是:在相同电力预算下,系统究竟能处理或生成多少内容。

CoreWeave 在实际运行的 Vera Rubin NVL72 上测试 DeepSeek-R1。其公布的结果显示,与 Grace Blackwell NVL72 相比,每兆瓦每秒 Token 吞吐量提升 10 倍。Google Cloud 的 A5X 裸金属实例也宣称,相较上一代,每 Token 推理成本降至十分之一,每兆瓦 Token 吞吐量提升 10 倍;伦敦初创公司 Ineffable Intelligence 已率先采用该实例。

这两个“10 倍”看起来互相呼应,但并非独立验证。材料没有给出完整的测试配置、并发量、功耗边界和成本计算口径。因此,更稳妥的理解是:NVIDIA 正在用单位电力产出和单位 Token 成本定义新一轮竞争,而不是已经证明所有任务都能获得同样提升。

散热和装机也成了性能问题

当竞争单位扩大到整座机架,过去像后勤的问题也会直接影响成本。Vera Rubin NVL72 采用托盘内无电缆、无风扇、无液冷软管的设计。据 InfoQ 报道,其计算托盘组装时间从数小时缩短至 1 分钟。

冷却同样被纳入系统设计。平台使用 45°C 的液冷进水,可不依赖冷水机组,仅使用干式冷却器;配合闭环液冷,每兆瓦每年可节省数百万加仑水。这里的关键不是“液冷”这个标签,而是更高的进水温度降低了制冷设施的要求。

为什么值得现在看

NVIDIA 正从销售单颗 GPU,转向提供计算、网络、散热和软件组成的整套数据中心平台。Rubin 把这条路线推得更远:当电力成为硬约束,芯片跑多快只是问题的一部分;利用率、网络等待、冷却消耗和部署速度,最终都会进入每 Token 成本。

换句话说,下一代算力竞争开始从芯片参数表移向数据中心的总账本。谁能让同一兆瓦电力稳定地产出更多 Token,谁才更接近商业上的优势。

局限与未知

  • CoreWeave 的结果虽来自实际硬件,但仍由合作伙伴公布,材料未附原始测试报告,也没有第三方复测。
  • Google Cloud 未披露“成本降至十分之一”的具体计算口径,不能把它与 CoreWeave 的吞吐量结果视为相互印证。
  • “机架已投入运行”与“全面量产”的具体覆盖范围不清,可能同时包含早期部署、验证和商业使用。

供稿材料 SOURCES — 1

← 返回 2026-08-01 · 科技板块