【文章标题】:TPU推理外部化全速推进 - InferenceX
【文章正文】:
十多年来,业界见证着谷歌凭借自研芯片构建帝国。搜索、广告、YouTube以及每一代Gemini都运行在TPU上。鲜有加速器能像TPU这样引发如此密集的架构审视,或关于其性能与经济性在设计公司外部表现的激烈讨论。Anthropic已成为TPU最大用户,其使用量预计在2029年前超越DeepMind自身用量。

来源:
谷歌

谷歌内部的成功从来不是问题。问题在于业界其余参与者能实际获取多少优势。能否采用开放权重模型,通过熟悉的推理引擎提供服务,并在影响业务的经济性指标上击败英伟达?

今日,我们首次发布第三方对TPUv7 Ironwood的推理测试结果于
InferenceX
官方预览版。在与B200/B300的同条件对比中,Ironwood每美元性能最高提升50%。其优势覆盖帕累托曲线大部分区间,我们从双重角度审视经济性:谷歌内部总体拥有成本与客户实际支付的外部总拥有成本。

Ironwood(TPUv7)是谷歌首代真正为外部推理负载竞争的芯片,支持直接购买或通过其云服务租赁。

2025年11月,我们已披露
Anthropic青睐TPU并承诺部署超百万颗(约40万+直接采购,60万+通过GCP租赁),主要用于训练但也涉及推理。

我们的加速器模型包含Anthropic TPU出货量及谷歌季度TPU总出货量最新数据,另含TPUv8i、v8t、多款v9/v10等预估

TorchTPU软件栈(TPU外部开发生态)的迅猛进展令人振奋。后文将探讨TPU软件外部化所需的重点工作,包括优化推测解码、解耦预填充、KV缓存卸载、多轮智能体负载等。即便如此,我们SemiAnalysis
坚信TPU外部化正朝着正确方向全速前进。

更何况,与仍在构建测试优先软件文化的AMD不同,谷歌拥有数十年软件工程积淀与极其成熟的质量驱动文化,我们预期外部TPU软件将快速成熟。

本文涵盖TPU内核与开放权重模型服务栈的全套优化方案,包括DP注意力优化、MoE路由与内核优化、GDN内核填充减少等。我们还将深度剖析TPU系统,探讨杰出TPU性能工程师为广泛普及该技术栈采取的下一步行动。

谷歌用十余年证明了TPU的潜力。现在轮到我们衡量业界能用它创造什么。

特别致谢谷歌团队(Chris Chan、
Jahangir Hasan、王元张、Anne Stern、Puneith Kaul、董瑞子、Sangam Jindal、周琦、Madhan Jaganathan、季刚、万军、Devanshu Jain、曹家欣、Srinath Mandalapu、宁浩文)
与Inferact团队打造的卓越TPU基础与性能!另致敬同样致力于TorchTPU SGLang的RadixArk团队。

InferenceX官方预览:TPUv7 Ironwood对决Blackwell与Blackwell Ultra

在与英伟达GPU的同条件对比中,即将推出的原生TorchTPU vLLM软件栈已显现强劲结果。谷歌采用FP8精度的Qwen3.5 397B作为初始启动模型。

后文将深入解析为何新版TorchTPU方案相较此前TorchAX路径在外部TPU vLLM/SGLang服务上实现显著提升。

立即订阅

基础就绪后,谷歌计划扩展对其他开放权重模型的支持,包括Kimi K3与GLM5.3。当少数模型完成深度优化后,我们相信在临近首发日时为大量热门开放模型添加优化支持将变得更为轻松。当前vLLM与SGLang的首发日支持集中于英伟达,对AMD提供尚可的覆盖。预计TorchTPU短期内将足够稳定,vLLM与SGLang维护者可能将TPU纳入首发支持列表。该技术栈预计10月前后结束封闭测试并开源。

在FP8聚合服务与单令牌预测的同条件对比中,TPU相较运行FP8聚合服务的B200/B300每美元性能最高领先50%。当英伟达GPU使用FP4服务模型时,相较FP8存在质量损失。TPUv7无原生FP4计算支持,故FP4场景下英伟达仍保持领先。这一局面将随原生支持FP4的TPUv8i Boardfly而改变,我们坚信其将具备强劲竞争力。