OpenAI 的 Jalapeño 芯片在推理测试中领先英伟达
The Decoder··作者 Matthias Bastian
关键信息
这款芯片只用于推理,不用于训练,而且 OpenAI 表示它是面向通用大语言模型的推理加速器,并不是只针对 OpenAI 自家模型优化。OpenAI 和 SemiAnalysis 还称,Jalapeño 在 GPT-OSS 120B 上实现了约每用户 1400 tokens/秒,在 Deepseek R1 670B 的单并发请求上超过 700 tokens/秒;同时它没有使用多 token 预测或 speculative decoding,因此后续仍可能继续提升。
资讯摘要
据报道,OpenAI 在 Hot Chips 大会上展示了其首款自研推理芯片 Jalapeño 的首批基准测试结果。该芯片只用于推理,也就是运行已经训练好的模型,而不是进行训练。OpenAI 同时将 Jalapeño 定位为通用的大语言模型推理加速器,而不是只针对自家模型定制的芯片。测试使用的是 SemiAnalysis 的公开基准 InferenceX,OpenAI 提供了数据,SemiAnalysis 还在实验室现场验证了部分运行结果。参与测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。根据报道,Jalapeño 在 GPT-OSS 上达到了约每用户 1400 tokens/秒,在 Deepseek R1 的单并发请求中超过 700 tokens/秒。
SemiAnalysis 认为它在单位功耗性能上的表现尤其突出,但也指出 Jalapeño 还没有使用多 token 预测或 speculative decoding 等优化手段。相比之下,部分对比系统已经采用了这些优化,因此 Jalapeño 仍然可能继续提升。报道还提到,英伟达和 AMD 已经公布过更大模型的测试结果,但这些模型尚未在 Jalapeño 上测试;同时 Jalapeño 目前据称仍停留在工程样品阶段。OpenAI 表示该芯片与 Broadcom 合作开发,设计工作在 2024 年中期启动,最终设计于 2025 年 11 月送去流片。OpenAI 还称自己在开发过程中使用了内部 AI 模型,较早一代模型用于芯片设计,较新模型则帮助编程和优化。SemiAnalysis 将这一结果解读为对英伟达长期以来 CUDA 护城河的挑战,而 OpenAI CFO Sarah Friar 则强调,Jalapeño 只是更大计算战略的一部分,这一战略把数据中心、芯片、模型、开发者平台、产品和设备整合在一起,同时也继续与英伟达、AMD、AWS、Cerebras 和 CoreWeave 等伙伴合作。

资讯正文
据报道,OpenAI 的首款定制芯片“Jalapeño”在推理基准测试中击败了 Nvidia 的 Blackwell 和 Rubin
OpenAI 在 Hot Chips 大会上展示了其内部推理芯片的首批基准测试结果。据称,“Jalapeño”在每瓦吞吐量和 token 延迟方面都优于 Nvidia 的 Blackwell 和 Rubin。
这款芯片只处理推理,这意味着它运行 AI 模型,但不会训练模型。Jalapeño 也并非针对 OpenAI 自家的模型进行调优。它是一款通用型 LLM 推理加速器。
这些结果来自 SemiAnalysis 的公开 InferenceX 基准测试。OpenAI 提供了相关数字,SemiAnalysis 在实验室现场核实了部分运行结果。测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。在 GPT-OSS 上,Jalapeño 的单用户吞吐量约为每秒 1,400 个 token。在 Deepseek R1 上,它在单个并发请求下的峰值超过每秒 700 个 token。
Jalapeño 在给出这些数字时,并没有使用 multi-token prediction 或 speculative decoding 等技术,而部分对比系统确实依赖这些优化,因此它仍有提升空间。
在其主打的能效对比中,SemiAnalysis 写道,“Jalapeño 让其他所有芯片都相形见绌。”SemiAnalysis 首席执行官 Dylan Patel 补充说:“通常第一代芯片都不具竞争力,但 OpenAI 正在击败 Nvidia Blackwell,甚至连 Rubin 也被压过。”
SemiAnalysis 指出,更公平的比较对象其实不是 Blackwell,而是 Nvidia 更新的 Vera Rubin 平台,因为两者都使用 HBM4 内存。即便如此,Jalapeño 在每兆瓦输出的 token 数上仍比 Vera Rubin 更高,尽管 Nvidia 的加速器使用了 Jalapeño 尚未采用的 multi-token prediction 优化。在每个 token 的总拥有成本上,两者大致相当。
不过,这里面也有一些需要注意的地方。Nvidia 和 AMD 已经公布了更大模型的结果,例如 Deepseek V4 Pro 和 Kimi K3,而这些模型尚未在 Jalapeño 上测试。并且,虽然 Rubin 系统已经开始向客户出货,但据报道,Jalapeño 仍未超出工程样品阶段。
OpenAI 在九个月内造出这款芯片,部分借助了自家的模型
OpenAI 与 Broadcom 合作开发了 Jalapeño。设计工作于 2024 年年中启动,最终设计在 2025 年 11 月送去流片。整个周期大约用了 16 个月,但 OpenAI 表示,从首版芯片设计到最终蓝图送往工厂之间只用了 9 个月。OpenAI 称,开发过程中使用了自家的 AI 模型。较早一代的模型帮助进行芯片设计,而更新的模型则加快了编程和优化速度。
SemiAnalysis 认为,这表明 Nvidia 备受讨论的“CUDA 护城河”或许已经不再成立。“鉴于 OpenAI 能如此迅速地用他们自己的硅芯片跑起新模型,CUDA 护城河可能已经死了,”该机构写道。
OpenAI 首席财务官 Sarah Friar 表示,这款芯片属于更广泛算力战略的一部分,在这一战略中,数据中心、芯片、模型、开发者平台、产品和设备共同作为一个整体系统运作。她称,Jalapeño 是对 OpenAI 现有与 Nvidia、AMD、AWS、Cerebras、CoreWeave 等伙伴关系的补充,而不是替代。
OpenAI 与其中几家公司有着深厚的联系。Nvidia、AMD 和 AWS 都是投资方或算力合作伙伴,其中 Nvidia 还是最大的投资方之一。它们每家公司也都在打造自己的 AI 芯片,这使得彼此之间既合作又竞争。尽管如此,这些公司都在不断表示,世界上的算力永远不够用,而这一说法也恰好有利于它们各自的商业模式。
来源与参考
收录于 2026-08-26