OpenAI 的 Jalapeño 芯片在推理测试中领先英伟达

The Decoder··作者 Matthias Bastian

关键信息

这款芯片只用于推理,不用于训练,而且 OpenAI 表示它是面向通用大语言模型的推理加速器,并不是只针对 OpenAI 自家模型优化。OpenAI 和 SemiAnalysis 还称,Jalapeño 在 GPT-OSS 120B 上实现了约每用户 1400 tokens/秒,在 Deepseek R1 670B 的单并发请求上超过 700 tokens/秒;同时它没有使用多 token 预测或 speculative decoding,因此后续仍可能继续提升。

资讯摘要

据报道,OpenAI 在 Hot Chips 大会上展示了其首款自研推理芯片 Jalapeño 的首批基准测试结果。该芯片只用于推理,也就是运行已经训练好的模型,而不是进行训练。OpenAI 同时将 Jalapeño 定位为通用的大语言模型推理加速器,而不是只针对自家模型定制的芯片。测试使用的是 SemiAnalysis 的公开基准 InferenceX,OpenAI 提供了数据,SemiAnalysis 还在实验室现场验证了部分运行结果。参与测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。根据报道,Jalapeño 在 GPT-OSS 上达到了约每用户 1400 tokens/秒,在 Deepseek R1 的单并发请求中超过 700 tokens/秒。

SemiAnalysis 认为它在单位功耗性能上的表现尤其突出,但也指出 Jalapeño 还没有使用多 token 预测或 speculative decoding 等优化手段。相比之下,部分对比系统已经采用了这些优化,因此 Jalapeño 仍然可能继续提升。报道还提到,英伟达和 AMD 已经公布过更大模型的测试结果,但这些模型尚未在 Jalapeño 上测试;同时 Jalapeño 目前据称仍停留在工程样品阶段。OpenAI 表示该芯片与 Broadcom 合作开发,设计工作在 2024 年中期启动,最终设计于 2025 年 11 月送去流片。OpenAI 还称自己在开发过程中使用了内部 AI 模型,较早一代模型用于芯片设计,较新模型则帮助编程和优化。SemiAnalysis 将这一结果解读为对英伟达长期以来 CUDA 护城河的挑战,而 OpenAI CFO Sarah Friar 则强调,Jalapeño 只是更大计算战略的一部分,这一战略把数据中心、芯片、模型、开发者平台、产品和设备整合在一起,同时也继续与英伟达、AMD、AWS、Cerebras 和 CoreWeave 等伙伴合作。

OpenAI 的 Jalapeño 芯片在推理测试中领先英伟达

资讯正文

据报道,OpenAI 的首款定制芯片“Jalapeño”在推理基准测试中击败了 Nvidia 的 Blackwell 和 Rubin

OpenAI 在 Hot Chips 大会上展示了其内部推理芯片的首批基准测试结果。据称,“Jalapeño”在每瓦吞吐量和 token 延迟方面都优于 Nvidia 的 Blackwell 和 Rubin。

这款芯片只处理推理,这意味着它运行 AI 模型,但不会训练模型。Jalapeño 也并非针对 OpenAI 自家的模型进行调优。它是一款通用型 LLM 推理加速器。

这些结果来自 SemiAnalysis 的公开 InferenceX 基准测试。OpenAI 提供了相关数字,SemiAnalysis 在实验室现场核实了部分运行结果。测试的模型包括 GPT-OSS 120B、Deepseek R1 670B 和 Kimi K2.5 1T。在 GPT-OSS 上,Jalapeño 的单用户吞吐量约为每秒 1,400 个 token。在 Deepseek R1 上,它在单个并发请求下的峰值超过每秒 700 个 token。

Jalapeño 在给出这些数字时,并没有使用 multi-token prediction 或 speculative decoding 等技术,而部分对比系统确实依赖这些优化,因此它仍有提升空间。

在其主打的能效对比中,SemiAnalysis 写道,“Jalapeño 让其他所有芯片都相形见绌。”SemiAnalysis 首席执行官 Dylan Patel 补充说:“通常第一代芯片都不具竞争力,但 OpenAI 正在击败 Nvidia Blackwell,甚至连 Rubin 也被压过。”

SemiAnalysis 指出,更公平的比较对象其实不是 Blackwell,而是 Nvidia 更新的 Vera Rubin 平台,因为两者都使用 HBM4 内存。即便如此,Jalapeño 在每兆瓦输出的 token 数上仍比 Vera Rubin 更高,尽管 Nvidia 的加速器使用了 Jalapeño 尚未采用的 multi-token prediction 优化。在每个 token 的总拥有成本上,两者大致相当。

不过,这里面也有一些需要注意的地方。Nvidia 和 AMD 已经公布了更大模型的结果,例如 Deepseek V4 Pro 和 Kimi K3,而这些模型尚未在 Jalapeño 上测试。并且,虽然 Rubin 系统已经开始向客户出货,但据报道,Jalapeño 仍未超出工程样品阶段。

OpenAI 在九个月内造出这款芯片,部分借助了自家的模型

OpenAI 与 Broadcom 合作开发了 Jalapeño。设计工作于 2024 年年中启动,最终设计在 2025 年 11 月送去流片。整个周期大约用了 16 个月,但 OpenAI 表示,从首版芯片设计到最终蓝图送往工厂之间只用了 9 个月。OpenAI 称,开发过程中使用了自家的 AI 模型。较早一代的模型帮助进行芯片设计,而更新的模型则加快了编程和优化速度。

SemiAnalysis 认为,这表明 Nvidia 备受讨论的“CUDA 护城河”或许已经不再成立。“鉴于 OpenAI 能如此迅速地用他们自己的硅芯片跑起新模型,CUDA 护城河可能已经死了,”该机构写道。

OpenAI 首席财务官 Sarah Friar 表示,这款芯片属于更广泛算力战略的一部分,在这一战略中,数据中心、芯片、模型、开发者平台、产品和设备共同作为一个整体系统运作。她称,Jalapeño 是对 OpenAI 现有与 Nvidia、AMD、AWS、Cerebras、CoreWeave 等伙伴关系的补充,而不是替代。

OpenAI 与其中几家公司有着深厚的联系。Nvidia、AMD 和 AWS 都是投资方或算力合作伙伴,其中 Nvidia 还是最大的投资方之一。它们每家公司也都在打造自己的 AI 芯片,这使得彼此之间既合作又竞争。尽管如此,这些公司都在不断表示,世界上的算力永远不够用,而这一说法也恰好有利于它们各自的商业模式。

来源与参考

  1. 原始链接
  2. OpenAI's first custom chip "Jalapeño" reportedly beats Nvidia's Blackwell and Rubin in inference benchmarks
  3. OpenAI’s Jalapeño chip is built for fast inference at scale, benchmarks show | TechCrunch

收录于 2026-08-26