OpenAI 自研 Jalapeño 芯片挑战 Nvidia 推理性能
The Decoder··作者 Matthias Bastian
关键信息
OpenAI 说,Jalapeño 是在 SemiAnalysis 的公开 InferenceX 基准上测试的,涉及的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。SemiAnalysis 还指出,Jalapeño 尚未使用多 token 预测或 speculative decoding 等优化,而且这款芯片目前仍只处于工程样片阶段。
资讯摘要
OpenAI 据称在 Hot Chips 会议上展示了其首款自研推理芯片 Jalapeño 的基准结果。该芯片只用于推理,也就是运行模型而不是训练模型。OpenAI 还表示,Jalapeño 并不是针对自家模型专门调优的,而是一款通用的 LLM 推理加速器。报道中的测试使用了 SemiAnalysis 的公开 InferenceX 基准,SemiAnalysis 也称自己在实验室现场验证了部分跑分。被测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。根据报道,Jalapeño 在 GPT-OSS 上大约达到每用户 1400 tokens/s,在 Deepseek R1 上单个并发请求的吞吐量超过 700 tokens/s。
SemiAnalysis 还指出,Jalapeño 在这些结果中没有使用多 token 预测或 speculative decoding 之类的优化,而部分对比系统已经用了这些手段。尽管如此,SemiAnalysis 仍称 Jalapeño 在性能/功耗方面领先,并在某些指标上超过了 Nvidia Blackwell 和 Vera Rubin,而与 Vera Rubin 的单 token 总拥有成本大致相当。报道同时给出了一些限制:Nvidia 和 AMD 已经公布了更大模型上的结果,但 Jalapeño 还没有参与这些对比,而且 Rubin 系统已经开始向客户交付,而 Jalapeño 仍停留在工程样片阶段。OpenAI 还表示,这款芯片是与 Broadcom 合作开发的,设计工作始于 2024 年中,最终设计在 2025 年 11 月送去流片;OpenAI 称从最初芯片设计到最终蓝图完成共用了 9 个月。OpenAI 还说,它在芯片设计、编程和优化中使用了自己的模型,SemiAnalysis 甚至据此认为 Nvidia 备受讨论的 CUDA 护城河可能正在减弱。与此同时,OpenAI 首席财务官 Sarah Friar 将 Jalapeño 描述为更大算力战略的一部分,认为数据中心、芯片、模型、开发者平台、产品和设备应作为一个整体来协同运作,并强调它是对 OpenAI 现有与 Nvidia、AMD、AWS、Cerebras 和 CoreWeave 等合作关系的补充,而不是替代。

资讯正文
据报道,OpenAI 的首款定制芯片“Jalapeño”在推理基准测试中击败了 Nvidia 的 Blackwell 和 Rubin
OpenAI 在 Hot Chips 大会上展示了其内部推理芯片的首批基准测试结果。据称,“Jalapeño”在每瓦吞吐量和 token 延迟方面都优于 Nvidia 的 Blackwell 和 Rubin。
这款芯片只处理推理,这意味着它运行 AI 模型,但不会训练模型。Jalapeño 也并非针对 OpenAI 自家的模型进行调优。它是一款通用型 LLM 推理加速器。
这些结果来自 SemiAnalysis 的公开 InferenceX 基准测试。OpenAI 提供了相关数字,SemiAnalysis 在实验室现场核实了部分运行结果。测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。在 GPT-OSS 上,Jalapeño 的单用户吞吐量约为每秒 1,400 个 token。在 Deepseek R1 上,它在单个并发请求下的峰值超过每秒 700 个 token。
Jalapeño 在给出这些数字时,并没有使用 multi-token prediction 或 speculative decoding 等技术,而部分对比系统确实依赖这些优化,因此它仍有提升空间。
在其主打的能效对比中,SemiAnalysis 写道,“Jalapeño 让其他所有芯片都相形见绌。”SemiAnalysis 首席执行官 Dylan Patel 补充说:“通常第一代芯片都不具竞争力,但 OpenAI 正在击败 Nvidia Blackwell,甚至连 Rubin 也被压过。”
SemiAnalysis 指出,更公平的比较对象其实不是 Blackwell,而是 Nvidia 更新的 Vera Rubin 平台,因为两者都使用 HBM4 内存。即便如此,Jalapeño 在每兆瓦输出的 token 数上仍比 Vera Rubin 更高,尽管 Nvidia 的加速器使用了 Jalapeño 尚未采用的 multi-token prediction 优化。在每个 token 的总拥有成本上,两者大致相当。
不过,这里面也有一些需要注意的地方。Nvidia 和 AMD 已经公布了更大模型的结果,例如 Deepseek V4 Pro 和 Kimi K3,而这些模型尚未在 Jalapeño 上测试。并且,虽然 Rubin 系统已经开始向客户出货,但据报道,Jalapeño 仍未超出工程样品阶段。
OpenAI 在九个月内造出这款芯片,部分借助了自家的模型
OpenAI 与 Broadcom 合作开发了 Jalapeño。设计工作于 2024 年年中启动,最终设计在 2025 年 11 月送去流片。整个周期大约用了 16 个月,但 OpenAI 表示,从首版芯片设计到最终蓝图送往工厂之间只用了 9 个月。OpenAI 称,开发过程中使用了自家的 AI 模型。较早一代的模型帮助进行芯片设计,而更新的模型则加快了编程和优化速度。
SemiAnalysis 认为,这表明 Nvidia 备受讨论的“CUDA 护城河”或许已经不再成立。“鉴于 OpenAI 能如此迅速地用他们自己的硅芯片跑起新模型,CUDA 护城河可能已经死了,”该机构写道。
OpenAI 首席财务官 Sarah Friar 表示,这款芯片属于更广泛算力战略的一部分,在这一战略中,数据中心、芯片、模型、开发者平台、产品和设备共同作为一个整体系统运作。她称,Jalapeño 是对 OpenAI 现有与 Nvidia、AMD、AWS、Cerebras、CoreWeave 等伙伴关系的补充,而不是替代。
OpenAI 与其中几家公司有着深厚的联系。Nvidia、AMD 和 AWS 都是投资方或算力合作伙伴,其中 Nvidia 还是最大的投资方之一。它们每家公司也都在打造自己的 AI 芯片,这使得彼此之间既合作又竞争。尽管如此,这些公司都在不断表示,世界上的算力永远不够用,而这一说法也恰好有利于它们各自的商业模式。
来源与参考