精华简报:OpenAI Jalapeño 推理芯片——性能、架构与战略影响
来源:SemiAnalysis
标题:OpenAI Jalapeño: Better Than Nvidia Blackwell
日期:基于 Hot Chips 发布及 SemiAnalysis 实验室验证
分析师:技术与商业分析简报
一、执行摘要
OpenAI 正式公布其首款推理芯片 Jalapeño,由 OpenAI 与博通(Broadcom)合作从零设计,专为 LLM 推理打造。该芯片在 SemiAnalysis 的 InferenceX 基准测试中,每瓦性能(perf/W)全面超越英伟达 Blackwell、AMD 及谷歌芯片,且未使用多令牌预测(MTP)、推测解码或预填充-解码分离等加速技术。Jalapeño 定位为通用推理芯片,而非仅针对 OpenAI 自有模型优化。其开发周期仅约 16 个月,显示 AI 加速芯片设计的实质性进展。尽管初步数据亮眼,但 SemiAnalysis 尚未完成完整 InferenceX 及 AgentX 套件验证,长期生产环境表现仍需观察。
二、关键事实与数据
| 维度 | 要点 |
|---|---|
| 开发时间线 | 2024 年中启动设计,约 16 个月完成流片,属极快 ASIC 开发周期 |
| 合作伙伴 | 博通(Broadcom) |
| 芯片定位 | 通用 LLM 推理芯片,非 OpenAI 模型专用 |
| 内存 | HBM4,与 NVIDIA/AMD 旗舰 GPU 同级 |
| 性能/W | 在 InferenceX 上击败所有测试的 NVIDIA、AMD、Google 芯片;未使用 MTP,对手均使用 MTP |
| 低延迟场景 | DeepSeek R1 并发 1 时 >700 tok/s/用户;Kimi-K2.5 与 GPT-OSS 约 1,400 tok/s/用户 |
| 模型精度 | GSM8k 评估结果与 NVIDIA 芯片相当 |
| 软件特性 | 单令牌预测(STP),无推测解码,无预填充-解码分离 |
三、深度分析
1. 通用芯片,而非专用加速器
媒体普遍误读 OpenAI 的“为自有模型优化”表述。SemiAnalysis 实地验证表明,Jalapeño 可运行多种开源模型(DeepSeek R1、Kimi-K2.5、GPT-OSS),甚至能运行移植版《毁灭战士》(Doom),证明其通用性。这一设计选择降低了单一模型架构变化带来的风险,并使其具备对外提供推理服务的潜力。
2. 性能/W 优势显著,但比较基准需谨慎
Jalapeño 在未启用 MTP 的情况下,每瓦性能仍超越启用 MTP 的竞品最佳配置。若与单令牌预测(STP)结果对比,优势更为悬殊。这表明其硬件-软件协同设计在能效上实现了代际跨越,尤其适合对功耗敏感的大规模推理部署。
3. 极快开发周期的意义
16 个月从团队组建到流片,远快于行业典型 ASIC 周期。这印证了 AI 辅助芯片设计(如使用大模型优化布局、验证)已从概念走向实践。OpenAI 的工程团队实力与充足资金投入是关键因素。
4. 对英伟达的竞争压力
若数据经完整验证,Jalapeño 将在推理市场直接挑战英伟达 Blackwell 的能效地位。考虑到 OpenAI 自身拥有巨大推理需求,该芯片可降低对外部 GPU 的依赖,同时可能通过 API 或云服务向外部提供高性价比推理算力。
四、局限与待验证点
-
数据来源与验证范围
所有性能数字由 OpenAI 提供。SemiAnalysis 仅在实验室实地验证了 InferenceX 的部分运行,未运行完整 InferenceX 套件,也未看到 AgentX 结果。 -
AgentX 缺失是关键风险
AgentX 是 SemiAnalysis 更偏好的基准,因其包含长上下文、多轮对话特性,能反映真实生产环境中的缓存行为。Jalapeño 在 8k/1k 等短序列基准上表现优异,但路由器、前缀缓存机制、缓存管理、卸载基础设施等组件在 AgentX 下可能暴露短板。文章在讨论此局限时被截断,完整结论未知。 -
单令牌预测 vs 多令牌预测
虽然 Jalapeño 未用 MTP 已领先,但若未来加入 MTP 或推测解码,性能可能进一步提升;反之,竞品也可能通过架构迭代缩小差距。 -
生态与软件成熟度
首代芯片的软件栈、编译器、驱动及框架兼容性尚未经过大规模生产验证。Doom 移植仅为演示,实际 LLM 推理框架的稳定性与易用性仍需观察。 -
供应链与量产
文章未提及代工厂、良率、产能及成本。HBM4 供应紧张可能影响大规模部署节奏。
五、商业与技术影响
- 对 OpenAI:垂直整合算力,降低推理成本,增强议价能力,可能加速模型迭代与商业化。
- 对英伟达:短期不会撼动训练市场,但推理市场面临实质性竞争。英伟达需加速能效优化或推出更具针对性的推理产品。
- 对博通:继谷歌 TPU 后,再获 OpenAI 大客户,巩固其定制 ASIC 领导地位。
- 对行业:证明“通用推理芯片 + 极致软硬件协同设计”路线可行,可能引发更多云厂商与模型公司自研推理芯片。
六、结论
OpenAI Jalapeño 在已披露的 InferenceX 基准中展现出代际领先的每瓦性能,且以通用芯片形态打破“首代芯片不具竞争力”的行业惯例。其极短开发周期与软硬件协同设计能力令人瞩目。然而,完整基准验证(尤其 AgentX)尚未完成,生产环境下的缓存管理、长上下文性能及软件生态成熟度仍是关键不确定因素。若后续验证通过,Jalapeño 将成为推理算力市场的重要变量,并对英伟达的推理主导地位构成实质性挑战。
简报基于 SemiAnalysis 文章已提供内容撰写,文章在 AgentX 局限性部分被截断,完整结论以原文为准。