你在晚高峰打开 AI,真正关心的不是它用了多少块芯片,而是答案能不能马上出来,服务会不会因为电力和成本太贵而限量。OpenAI 的新芯片 Jalapeño 瞄准的正是这件事:让训练完成的模型以更低延迟回答更多用户,同时少耗电。首批跑分看起来很亮眼,但目前公开的主要是 OpenAI 自己公布的结果,具体测试数据和独立复测仍然缺席。
第一次跑分,赢在两个方向
Jalapeño 是 OpenAI 自研的 AI 推理芯片。推理(inference),指模型训练完成后接收请求、生成答案的过程。训练像是长期学习,推理则是每天真正上岗答题;两者的计算方式不同,芯片也可以分别优化。
OpenAI 在 Hot Chips 会议上披露了 Jalapeño 的首批基准测试结果。按照 TechCrunch 的报道,这款芯片参加了 SemiAnalysis 的 InferenceX 测试,在两项指标上超过当前可用的顶尖推理处理器,其中包括 Nvidia Blackwell 系统。
一项是每用户 token 数。token 是模型处理文字时使用的小单位,这项指标反映系统能以多快的速度持续向用户返回内容。另一项是每千瓦吞吐量,也就是消耗相同电力时,系统能完成多少推理工作。
这两项分别对应用户体验和数据中心账本。延迟越低,单个用户等待答案的时间越短;吞吐量越高,同一套系统能同时服务更多请求;每千瓦吞吐量越高,有限的电力和散热条件下就能承载更多业务。OpenAI 硬件负责人 Richard Ho 将其称为相对现有水平“非常显著”的性能进步。不过,这是公司对自家测试结果的表述,材料没有给出具体吞吐量、延迟、功耗或领先百分比。
芯片为什么要围着模型来造?
Jalapeño 的关键思路不是单独追求一块更快的芯片,而是把产品、模型、芯片和内存放在一起设计。OpenAI 计划将它发展成一个多代平台,让这些环节协同演进。
这可以理解为不再购买一套通用厨房设备,再让所有菜迁就设备,而是先确定每天要做什么菜,再安排炉灶、备料台和传菜路线。AI 推理也不只是执行计算。数据还要在计算单元、内存和网络之间反复移动,移动本身就会消耗时间与电力。
OpenAI 表示,Jalapeño 重点处理推理中的 prefill 和通信瓶颈。prefill 是模型收到一段输入后,先把整段内容读入并形成内部状态的阶段。输入越长,这一步的工作通常越多。通信阶段则涉及不同计算、内存和网络资源之间交换数据。
它的做法是减少数据移动和通信等待,并把模型状态尽量留在本地。这里包括 KV cache——模型生成答案时保存的一组中间结果,像放在手边的草稿纸,后续生成新内容时不必不断回头重算。系统再根据推理所处的阶段,调动合适的计算、内存与网络组合。
据 TechCrunch 报道,Jalapeño 由 OpenAI 与 Broadcom 密切合作开发,OpenAI 自有模型也参与了开发过程。材料没有进一步说明模型具体承担了哪些设计任务,因此不能据此判断 AI 在芯片研发中发挥了多大作用。
挑战 Nvidia,不只是一场跑分
OpenAI 长期是 Nvidia GPU 的大型使用者。自研推理芯片意味着,它正在尝试掌握从模型、芯片到产品服务的更多环节,减少对单一供应商和通用硬件的依赖。
我们此前连续讨论过,Nvidia 如何通过融资、GPU 残值支持和担保巩固算力需求。这次的变化在于,OpenAI 不再只是参与围绕数据中心和 GPU 展开的融资链,也开始把手伸向 Nvidia 的核心产品位置。
这种全栈竞争的价值在于,各层优化可以相互放大。模型知道自己最常遇到哪些推理瓶颈,芯片就能针对这些环节安排计算与内存;产品知道用户更在意等待时间还是并发能力,系统也可以据此取舍。OpenAI CFO Sarah Friar 对这一方向的概括是:芯片、算力、模型与产品的改进可以叠加,以更低成本提供更大规模的智能服务。
不过,“正面挑战”目前更准确地描述了竞争方向,而不是市场结果。Jalapeño 尚未证明自己已经在量产能力、实际部署规模或商业份额上追平 Nvidia。
局限与未知
- 现有材料没有披露芯片规格、测试配置和具体分数,也没有独立第三方复测。所谓领先,应理解为 OpenAI 公布的基准结果,而非已经得到外部验证的结论。
- 据 TechCrunch 单一信源报道,Jalapeño 到 2026 年底只会以“非常小的规模”部署,较大规模部署要等到 2027 年。届时 Nvidia 的产品也可能已经迭代,因此今天与 Blackwell 的比较不能直接推导未来竞争格局。
- Broadcom 的合作方式、OpenAI 模型参与开发的具体程度,以及大规模部署后的成本和稳定性,现有材料都没有展开。
Jalapeño 最值得关注的地方,因而不只是一次声称领先的跑分。它显示 OpenAI 正从购买算力走向定义算力:不仅训练和提供模型,也试图决定芯片如何计算、内存如何配合、产品如何使用这些能力。这条路能否真正撼动 Nvidia,要等量产和真实负载检验;但竞争的边界,已经向下推进了一层。