OpenAI「辣椒」芯片基准首秀:700瓦能耗超英伟达1400瓦旗舰,推理战场格局开始动摇

2026年8月25日,OpenAI在Hot Chips年度芯片技术大会上公布了自研AI推理芯片Jalapeño的首批公开基准测试结果:在SemiAnalysis发布的InferenceX基准测试中,Jalapeño每瓦完成的AI推理工作量是英伟达GB200和GB300系统的1.5至1.9倍,端到端延迟缩短至对照系统的28%至59%。这块标称功耗700瓦的芯片,在效率上全面碾压标称功耗1400瓦的英伟达旗舰。

OpenAI硬件负责人Richard Ho在发布会后对媒体表示:"Jalapeño每单位能耗能够承载更多AI工作,同时响应速度更快。它可以高效服务大规模用户,也可以做到极低延迟。" Sam Altman的表述则更为简洁:"我们做了一块芯片,它很快。"

这块芯片究竟做了什么

Jalapeño是OpenAI与博通联合开发的定制AI加速器,从设计之初就只瞄准大模型推理。这与英伟达GPU的"训练+推理通吃"路线截然不同。专用化意味着可以在架构层面做出很多通用GPU不敢做的取舍。

这次测试覆盖三款在业界具有代表性的开源模型:GPT-OSS 120B、DeepSeek R1 670B和Kimi K2.5 1T。以DeepSeek R1为例,一次8K输入、1K输出的推理任务,耗时从5.99秒降至1.65秒;最小token生成间隔从5.90毫秒压缩至1.43毫秒。据SemiAnalysis的测试数据,在交互式低延迟场景下,Jalapeño的优势进一步扩大至2.1至4.1倍。

从整个机架维度看,128块Jalapeño加速器组成一个系统,提供1.7 exaFLOPS的4比特算力,配备27.5TB的HBM4内存和接近2 petabytes/sec的内存带宽。

为什么快:打穿"内存墙"

现代AI芯片的计算速度早已超越数据搬运速度——芯片算得快,但权重和KV Cache从内存搬到计算核心的速度跟不上,计算单元大量时间在等数据。这是大模型推理领域长期存在的"内存墙"问题。

Jalapeño的解法是将计算、内存和片间网络纳入统一架构设计,而非将其视为独立模块拼接。据SemiAnalysis披露,每颗Jalapeño配备216GiB HBM4内存,内存带宽达到15.4TB/s,约为微软Maia 200(HBM3e)的两倍。芯片内部将计算核心与HBM划分为多个相互对应的本地区域,模型权重和KV Cache优先留在负责处理它们的本地内存中,跨区域通信才经过专用高速网络完成。

功耗数据是这套架构优势最直接的体现:Jalapeño标称功耗700瓦,实测持续功耗低于550瓦;英伟达GB200标称功耗1200瓦,GB300则为1400瓦。数据中心的电力成本是实实在在的运营支出,能效比上的差距意味着同等规模算力所需的电费、制冷和机柜空间都将大幅缩减。

九个月造一块AI芯片

Jalapeño的研发周期同样值得关注。据OpenAI官方博客披露,Jalapeño从正式设计启动到流片仅用了九个月。据Semiconductor Engineering的行业估算,这类高复杂度AI加速芯片的正式设计周期通常需要18至24个月。

时间线如下:项目约在2025年2月进入正式设计阶段,初始团队多来自前Google TPU项目;2025年11月完成流片;2026年5月OpenAI拿到第一块成品芯片;2026年8月完成调试并在Hot Chips公开测试结果。关键的一点是,OpenAI自己的AI模型深度参与了这一过程:方案探索、设计验证、算术电路优化均有模型介入。芯片到手后,OpenAI又用Codex和内部模型,在两个月内完成了DeepSeek R1和Kimi K2.5等原本不在适配计划中的模型的支持。

英伟达的护城河在哪里

Jalapeño是纯推理芯片,不涉及训练任务。英伟达在AI训练领域的统治地位——依托CUDA生态和H系列/B系列GPU——目前没有任何芯片能够正面挑战。

据多家机构估算,英伟达目前占据AI芯片市场约70至75%的份额(按数据中心AI加速器收入计算)。而据Tom's Hardware的行业分析,自定义AI服务器ASIC出货量在2026年的年增速约为44.6%,远高于商用GPU的16.1%增速。两者目前处于共存而非替代关系。

OpenAI自己也明确表示将继续购买英伟达GPU。硬件的现实是:大规模训练新模型仍然依赖英伟达的生态,而日常推理服务的规模和频次则是另一个量级——运营一个全球数亿用户的产品,推理成本才是最大的持续性支出。在这个层面上,Jalapeño解决的是一个真实存在的规模经济问题。

博通的隐形版图

Jalapeño不是一个孤立事件,而是更大趋势的组成部分。博通目前同时承接谷歌TPU、Meta MTIA、微软Maia和OpenAI Jalapeño的芯片设计合作,在AI服务器定制ASIC领域的设计合作市场占有率约为60%。每一家顶级AI实验室或超大规模云服务商走上"自研芯片"路线,背后几乎都有博通的身影。

这个格局揭示了一个行业结构性转变:AI算力正在从"采购英伟达标准产品"走向"垂直整合定制硅",而博通成为了这条路上最重要的基础设施供应商。谁掌握模型、谁承担推理成本,谁就有动力做自研芯片。这不仅是OpenAI一家的逻辑,也是谷歌、亚马逊、微软、Meta各自走过的路。

结论

这是OpenAI第一次拿出可以公开对比的实物基准数据,而不是PPT或概念演示。700瓦完成1400瓦英伟达旗舰系统两倍工作量的数字,意味着AI推理的成本结构将从根本上被重写。

英伟达在训练领域的壁垒短期内无法撼动,但推理市场恰恰是当前AI服务商花钱最多的地方。这场自研芯片竞赛的核心逻辑,从来不是"打倒英伟达",而是"推理成本是否可以降下来到支撑更大规模的AI应用"。Jalapeño给出的答案,是目前最有力的一个。