如果一家 AI 公司每天要回答海量问题,它最在意的不只是芯片跑得快,还要看每度电能处理多少请求、用户要等多久。OpenAI 的新答案是 Jalapeño:一款为模型回答问题而定制的推理芯片。它不能全面替代 Nvidia,却说明头部模型公司正把“少买一些通用 GPU”从远期设想变成实际产品。
目前公开信息只有一篇报道,其中性能数字和研发进度大多来自 OpenAI 自己,尚无原始报告、统一测试配置或第三方复测。所谓“九个月造芯”,也只是从初始设计到 tape-out,并非九个月完成制造、量产和部署。
九个月,完成的是哪一步?
推理(inference)是模型训练完成后生成答案或预测的过程。调用量足够大、任务又相对稳定时,公司可以用 ASIC——为特定工作负载定制的芯片——针对常用计算优化功耗和性能。代价是灵活性通常不如 GPU。
OpenAI 称,Jalapeño 从初始设计到 tape-out 只用了九个月,自有模型也参与并加速了设计流程。Tape-out 指设计团队完成最终版图,并把它交给晶圆厂制造。可以把它理解为建筑图纸正式定稿送去施工:关键设计已经结束,但大楼还没有建成,更谈不上投入使用。
这也不是 OpenAI 独自包办的“自研”。OpenAI 负责架构设计;Broadcom 负责 physical implementation,也就是把逻辑设计变成可制造的晶体管布局、布线和时序版图,并提供 Tomahawk 网络;Celestica 负责板卡、机架和系统集成;TSMC 负责制造。真正值得注意的,是 OpenAI 用自己的模型定义芯片,再借成熟供应链快速把设计落到硅片上。
它真的击败 Nvidia 了吗?
据 OpenAI 公布的 InferenceX 结果,Jalapeño 在三个大型开放模型上,相较对比系统实现了 1.5 至 1.9 倍的每瓦工作量,端到端延迟则低 1.7 至 3.6 倍。对比对象包括 Nvidia GB200 和 GB300 系统。简单说,同样用电,它声称能处理更多任务;从请求进入到答案完成,等待时间也更短。
OpenAI 给 Jalapeño 标定的额定功耗是 700 瓦,同时称实测持续功耗不超过 550 瓦。两个数字口径不同,并不直接矛盾,但报道没有披露具体负载和测量条件。
因此,“Nvidia-beating”只能作很窄的理解。Jalapeño 赢的是 OpenAI 选择的部分推理测试,不是所有 AI 计算。部分测试偏重 single-token prediction——一次预测一个 token,也就是模型生成文字时的基本单位;Nvidia 系统则可采用一次预测多个 token 的技术。Jalapeño 也没有与 Vera Rubin 比较。
更重要的是,它是推理芯片,不是训练加速器。训练是让模型学会能力的阶段,对芯片和软件的要求不同。Jalapeño 无法替代 Nvidia 的 CUDA 训练生态。因此,它更像是在一个高频、稳定的工作区间里争夺成本优势,而不是把 Nvidia 整套平台搬走。
真正的变化在供应链
Jalapeño 的意义不只在一张性能表。每当定制推理芯片接走一部分长期、重复的工作负载,模型公司对高价通用 GPU 的依赖就可能下降。与此同时,Broadcom 这类定制芯片伙伴可以帮助 Nvidia 的大客户变成芯片设计者,并从物理实现和网络环节获得收入。
这种合作还有更大的前瞻目标:OpenAI 与 Broadcom 计划在 2029 年前部署 10 吉瓦的 OpenAI 设计加速器。报道还称,Broadcom 上一季度 AI 半导体收入增长 143%,达到 108 亿美元。不过,部署计划尚未实现,收入增长也不能直接证明 Jalapeño 将具备量产经济性。
局限与未知
- Jalapeño 预计到年末才开始部署,量产成本、良率和实际运行经济性仍未验证。
- 性能、延迟和九个月研发周期均来自 OpenAI 的说法,缺少完整测试配置与第三方复测。
- 现有结果只支持“特定推理任务更高效”,不能外推为全面超越 Nvidia,更不能视为替代 CUDA 训练生态。