OpenAI自研推理芯片Jalapeño首次公布基准测试:能效超越Nvidia GB300
关键词: OpenAI Jalapeño 自研芯片 推理芯片
当地时间8月25日,OpenAI在Hot Chips大会上公布了其首款自研AI推理芯片Jalapeño的首批基准测试结果。

(Jalapeño芯片测试电路板)
低功耗下的推理突破
OpenAI硬件负责人Richard Ho在发布会上表示,Jalapeño在SemiAnalysis的InferenceX公开基准测试中展现出"非常、非常显著的性能进步"。测试覆盖了三款不同规模的公开模型,包括OpenAI自家的GPT-OSS 120B、DeepSeek R1 670B以及Moonshot AI的Kimi K2.5 1T。结果显示,Jalapeño在峰值吞吐量下实现了比对比系统高1.5倍至1.9倍的每瓦AI工作量,同时将端到端延迟降低了1.7倍至3.6倍。
对于高度交互式的AI Agent类任务,其性能优势进一步扩大至2.1倍至4.1倍。在极低延迟场景下,这一优势更为夸张。当匹配GB300此前最快的解码速度时,Jalapeño的每千瓦吞吐量最高达到了现有最优水平的104.3倍。

(Jalapeño每千瓦混合token吞吐量对比图)
据 SemiAnalysis 测试数据,Jalapeño 在 GPT-OSS 120B 上可达到1459 tokens/s/user 的解码速度,token 间隔低于 1 毫秒;在 DeepSeek R1 上,单并发请求速度为700 tokens/s/user。
值得注意的是,这些成绩是在Jalapeño未使用多token预测(MTP)或推测解码等软件优化技术的情况下取得的,而部分对比系统依赖了这些优化。
从硬件规格看,Jalapeño采用台积电N3P工艺制造,单颗芯片热设计功耗为700W,但OpenAI表示实测持续功耗在测试负载下保持在550W或更低。
芯片集成6个HBM4堆栈,提供216GiB内存和15.4TB/s带宽,在标称功耗下每瓦内存容量比GB300高出约50%。其计算裸片提供13.4 PFLOPs的MXFP4算力。
SemiAnalysis在其实验室与OpenAI工程师共同完成测试后评价称,Jalapeño"击败了我们测试过的每一颗Nvidia、AMD和Google芯片"。
部署路线图浮出水面
Jalapeño从初始设计到流片仅用时9个月,OpenAI称其为自己模型参与加速设计的结果。公司透露,第二代芯片已"深入开发"阶段,预计数月内流片,第三代的概念设计也已在进行中。此外,据报道下一代B0版本已在制造中,预计每瓦性能将再提升约25%。
在部署层面,OpenAI计划于今年年底在其自有基础设施中小规模上线Jalapeño,并在2027年显著扩大部署规模,大部分产出预计安排在第四季度。
Jalapeño的数据中心部署架构以机架为单位,每个机架可容纳128颗芯片,提供1.7exaflops的4位计算能力和27.5TB HBM4内存;一个完整计算集群(pod)由16个机架共2048颗ASIC组成。最多可跨16个机架扩展连接,下一代部署目标约为100兆瓦。这一部署节奏与OpenAI和Broadcom去年10月签署的10GW合作协议相吻合。
不过OpenAI强调不会向外部客户销售Jalapeño芯片,Richard Ho表示:"我们在OpenAI内部有大量的计算需求,要满足这些需求需要大量算力,我们现在已经供不应求。"
英伟达受到挑战
尽管基准测试结果令人瞩目,Jalapeño对Nvidia构成的威胁仍需放在具体语境中审视。首先,该芯片专为推理设计,不适用于模型训练,而在训练领域Nvidia的硬件地位仍然无可撼动。
其次,OpenAI在发布基准时并未与Nvidia最新一代的Vera Rubin平台进行直接对比。Vera Rubin已开始向客户出货,而Jalapeño据报道尚未走出工程样品阶段。
SemiAnalysis 尝试将 Jalapeño 的测试数据与 Vera Rubin 已公开发布的结果进行交叉推算后认为,即便Vera Rubin使用了多token预测优化而Jalapeño尚未采用,Jalapeño在每兆瓦输出token数上仍略胜一筹;但在单token总拥有成本上,两者大致持平。
需要指出的是,这种对比并非同步进行的直接对比测试,模型、输入长度、推理方法和软件成熟度均存在差异。此外,当Jalapeño与运行多token预测的GB300直接对比时,其峰值效率优势会缩小至约1.5倍。
更微妙的局面在于,OpenAI与Nvidia的关系既是竞争也是深度依赖。就在基准发布前一周,Nvidia同意为OpenAI在俄亥俄州租赁的数据中心园区提供最高1050亿美元的融资支持。Richard Ho在基准发布后接受彭博社采访时明确表示:"Nvidia是一个非常好的合作伙伴,我们继续需要大量Nvidia芯片。"
然而,Jalapeño的规模化部署可能在一个关键领域对Nvidia形成实质性挤压:HBM4供应。当前三星、SK海力士和美光的HBM产能已预订至2027年,供应紧张到传闻Nvidia正在测试仅配备192GB内存的精简版Rubin Ultra配置。若OpenAI按照10GW协议大规模铺开Jalapeño,它将成为HBM4市场的重量级新买家,直接与Nvidia争夺本就稀缺的内存产能。