你向 AI 提问后,答案是逐字蹦出来,还是几乎瞬间铺满屏幕,背后对应的是同一个问题:模型不只要会回答,还要答得够快。训练让模型学会能力,推理则是训练完成后实际生成答案的阶段。随着 AI 进入日常服务,响应速度、吞吐量和每次调用成本,正在变成数据中心采购的核心指标。
英伟达如今把一条不同于传统 GPU 的推理路线装进了整套机架。据 CNBC 报道,Groq 3 LPX 已进入全面量产,并计划于 2026 年晚些时候部署到新型 AI 云服务商 Nebius。它会与 Vera CPU、Rubin GPU 配合工作。这意味着英伟达与 Groq 的合作不再只是纸面上的技术授权,而是开始变成客户可以部署的数据中心设备。
不过,所谓“约200亿美元交易”需要说得准确些。官方将双方安排称为“非独家技术许可协议”,并强调没有收购 Groq 公司;媒体则称英伟达在 2025 年 12 月以约200亿美元取得相关技术、资产并吸收核心团队。精确金额没有得到官方确认。按媒体口径计算,这仍是英伟达有史以来金额最大的交易。
不是替换 GPU,而是给生成答案配一条快车道
Groq 由前 Google TPU 工程师 Jonathan Ross 创办。它主打 LPU,即 Language Processing Unit——一种强调可预测、低延迟的 AI 推理处理器。说白了,GPU 擅长承担大量并行计算,LPU 在这里主要负责让模型快速、稳定地把答案一个 token 接一个 token 地生成出来。Token 可以理解为模型处理文字时使用的基本片段。
Groq 3 LPX 的分工也很清楚:它主要承担低延迟解码,也就是 token generation;Vera Rubin GPU 则负责 prefill、训练及其他高吞吐计算。Prefill 是模型先读完用户输入、建立中间状态的阶段。可以把这套组合想成餐厅:GPU 负责一次性备好大量食材,LPU 负责按顺序迅速出菜。两者处理的环节不同,并非简单的替代关系。
每套液冷 Groq 3 LPX 机架装有 256 颗 Groq 3 LPU。机架级系统不只是把芯片塞进柜子,而是把 CPU、网络、内存、散热和软件作为一个整体交付。采购方因此比较的不再只是某颗芯片跑得多快,而是整套设备能否稳定接入现有数据中心。
据报道,这套机架可以与 Vera Rubin 系统结合,并继续使用 NVIDIA CUDA 软件栈。不过这一点目前只有单一独立信源支持,尚不能进一步推导为客户完全不需要调整工作流程,更不能直接坐实所谓“软件锁定加深”。
3400 tokens/s,快,但别急着横比
英伟达援引 Artificial Analysis 的测试称,Groq 3 LPX 运行 Gemma 4 31B、输入上下文为 100K tokens 时,速度约为每秒生成 3400 个 output tokens。这个数字最直观的含义,是它把低延迟生成能力推到了很高水平。
外界也把它与 OpenAI 的 Cerebras 驱动 Ultrafast 模式相比。后者为 GPT-5.6 Sol 提供的速度最高为每秒 750 个 output tokens。简单相除,前者约为后者的 4.5 倍,但这不是严谨的性能排名:两项测试运行的模型、上下文长度、服务形态和环境不同。它们更像两辆车在不同道路上的测速,不能据此断言英伟达整体推理性能快了 4.5 倍。
另一个值得留意的变化来自供应链。Groq 3 LPX 的芯片由 Samsung 制造,而英伟达主力 GPU 通常由 TSMC 代工。新机架因此不仅扩展了英伟达的计算架构,也引入了不同的制造来源。
真正的看点,是采购单位变了
这次落地把竞争从单颗芯片推向整套数据中心系统。Nebius 属于 neocloud——专门向 AI 客户出租 GPU 等算力的新一代云服务商,也是新硬件较早进入生产环境的重要买家。它采购的不是一颗孤立的 LPU,而是一套把低延迟推理、GPU 计算、网络、散热和软件整合起来的机架。
从 2025 年 12 月公布交易,到 Groq 3 LPX 全面量产并确定 Nebius 采用,约用了八个月。这个速度说明相关技术已经形成具体产品,但“全面量产”不等于普通云用户已经可以买到服务。Nebius 的部署仍是 2026 年晚些时候的计划。
Groq 的创业故事也让这次转折更有意味。据 Forbes 报道,合作最初源于 Ross 想向英伟达购买约10万颗 Blackwell GPU,并提出让两家硬件协同。会议三天后,Jensen Huang 回电,希望迅速推进;约三周后,双方在平安夜公布了技术许可及大规模吸收团队的安排。Ross 后来承认,他一度怀疑两种芯片能否顺利整合。如今 Groq 3 LPX 正是这次合作的首个重要落地。
局限与未知
- 官方没有确认约200亿美元的精确对价,交易究竟包含哪些资产、权利与长期义务,公开材料仍不完整。
- 目前披露的是量产状态与 Nebius 的未来部署计划,尚无实际生产环境中的成本、能耗、稳定性或客户使用数据。
- 3400 tokens/s 只对应特定模型与 100K 输入上下文,不能外推为所有模型、所有场景下的速度,也不能直接证明商业回报。
这笔押注是否划算,还要等真实客户负载和成本数据回答。但方向已经清楚:英伟达正在把推理竞争重新包装成系统竞争。未来云服务商选购的,可能不再是哪颗芯片最快,而是哪套机架能把训练、读入问题和生成答案更顺畅地接在一起。