精华简报:OpenAI Jalapeño 推理芯片——性能、架构与战略影响

来源:SemiAnalysis
标题:OpenAI Jalapeño: Better Than Nvidia Blackwell
日期:基于 Hot Chips 发布及 SemiAnalysis 实验室验证
分析师:技术与商业分析简报


一、执行摘要

OpenAI 正式公布其首款推理芯片 Jalapeño,由 OpenAI 与博通(Broadcom)合作从零设计,专为 LLM 推理打造。该芯片在 SemiAnalysis 的 InferenceX 基准测试中,每瓦性能(perf/W)全面超越英伟达 Blackwell、AMD 及谷歌芯片,且未使用多令牌预测(MTP)、推测解码或预填充-解码分离等加速技术。Jalapeño 定位为通用推理芯片,而非仅针对 OpenAI 自有模型优化。其开发周期仅约 16 个月,显示 AI 加速芯片设计的实质性进展。尽管初步数据亮眼,但 SemiAnalysis 尚未完成完整 InferenceX 及 AgentX 套件验证,长期生产环境表现仍需观察。


二、关键事实与数据

维度要点
开发时间线2024 年中启动设计,约 16 个月完成流片,属极快 ASIC 开发周期
合作伙伴博通(Broadcom)
芯片定位通用 LLM 推理芯片,非 OpenAI 模型专用
内存HBM4,与 NVIDIA/AMD 旗舰 GPU 同级
性能/W在 InferenceX 上击败所有测试的 NVIDIA、AMD、Google 芯片;未使用 MTP,对手均使用 MTP
低延迟场景DeepSeek R1 并发 1 时 >700 tok/s/用户;Kimi-K2.5 与 GPT-OSS 约 1,400 tok/s/用户
模型精度GSM8k 评估结果与 NVIDIA 芯片相当
软件特性单令牌预测(STP),无推测解码,无预填充-解码分离

三、深度分析

1. 通用芯片,而非专用加速器

媒体普遍误读 OpenAI 的“为自有模型优化”表述。SemiAnalysis 实地验证表明,Jalapeño 可运行多种开源模型(DeepSeek R1、Kimi-K2.5、GPT-OSS),甚至能运行移植版《毁灭战士》(Doom),证明其通用性。这一设计选择降低了单一模型架构变化带来的风险,并使其具备对外提供推理服务的潜力。

2. 性能/W 优势显著,但比较基准需谨慎

Jalapeño 在未启用 MTP 的情况下,每瓦性能仍超越启用 MTP 的竞品最佳配置。若与单令牌预测(STP)结果对比,优势更为悬殊。这表明其硬件-软件协同设计在能效上实现了代际跨越,尤其适合对功耗敏感的大规模推理部署。

3. 极快开发周期的意义

16 个月从团队组建到流片,远快于行业典型 ASIC 周期。这印证了 AI 辅助芯片设计(如使用大模型优化布局、验证)已从概念走向实践。OpenAI 的工程团队实力与充足资金投入是关键因素。

4. 对英伟达的竞争压力

若数据经完整验证,Jalapeño 将在推理市场直接挑战英伟达 Blackwell 的能效地位。考虑到 OpenAI 自身拥有巨大推理需求,该芯片可降低对外部 GPU 的依赖,同时可能通过 API 或云服务向外部提供高性价比推理算力。


四、局限与待验证点

  1. 数据来源与验证范围
    所有性能数字由 OpenAI 提供。SemiAnalysis 仅在实验室实地验证了 InferenceX 的部分运行,未运行完整 InferenceX 套件,也未看到 AgentX 结果。

  2. AgentX 缺失是关键风险
    AgentX 是 SemiAnalysis 更偏好的基准,因其包含长上下文、多轮对话特性,能反映真实生产环境中的缓存行为。Jalapeño 在 8k/1k 等短序列基准上表现优异,但路由器、前缀缓存机制、缓存管理、卸载基础设施等组件在 AgentX 下可能暴露短板。文章在讨论此局限时被截断,完整结论未知。

  3. 单令牌预测 vs 多令牌预测
    虽然 Jalapeño 未用 MTP 已领先,但若未来加入 MTP 或推测解码,性能可能进一步提升;反之,竞品也可能通过架构迭代缩小差距。

  4. 生态与软件成熟度
    首代芯片的软件栈、编译器、驱动及框架兼容性尚未经过大规模生产验证。Doom 移植仅为演示,实际 LLM 推理框架的稳定性与易用性仍需观察。

  5. 供应链与量产
    文章未提及代工厂、良率、产能及成本。HBM4 供应紧张可能影响大规模部署节奏。


五、商业与技术影响

  • 对 OpenAI:垂直整合算力,降低推理成本,增强议价能力,可能加速模型迭代与商业化。
  • 对英伟达:短期不会撼动训练市场,但推理市场面临实质性竞争。英伟达需加速能效优化或推出更具针对性的推理产品。
  • 对博通:继谷歌 TPU 后,再获 OpenAI 大客户,巩固其定制 ASIC 领导地位。
  • 对行业:证明“通用推理芯片 + 极致软硬件协同设计”路线可行,可能引发更多云厂商与模型公司自研推理芯片。

六、结论

OpenAI Jalapeño 在已披露的 InferenceX 基准中展现出代际领先的每瓦性能,且以通用芯片形态打破“首代芯片不具竞争力”的行业惯例。其极短开发周期与软硬件协同设计能力令人瞩目。然而,完整基准验证(尤其 AgentX)尚未完成,生产环境下的缓存管理、长上下文性能及软件生态成熟度仍是关键不确定因素。若后续验证通过,Jalapeño 将成为推理算力市场的重要变量,并对英伟达的推理主导地位构成实质性挑战。


简报基于 SemiAnalysis 文章已提供内容撰写,文章在 AgentX 局限性部分被截断,完整结论以原文为准。