TPU推理外部化全速推进 - InferenceX 精华简报
TL;DR 核心主旨
谷歌TPUv7 Ironwood在第三方推理测试中展现出对英伟达B200/B300最高50%的每美元性能优势,标志着其首次真正具备外部推理市场竞争力,并通过TorchTPU软件栈的快速成熟与Anthropic百万级部署案例,开启TPU生态外部化的关键转折点。
核心观点与技术/商业洞察
1. 性能与经济性突破
- TPUv7 Ironwood:首代面向外部推理市场的TPU,FP8精度下比英伟达B200/B300每美元性能高50%(FP4场景仍落后)
- 帕累托优势:覆盖大部分经济性曲线区间,谷歌同时优化内部TCO与客户外部TCO
- 路线图:TPUv8i Boardfly将原生支持FP4,补足当前短板
2. 生态建设加速
- TorchTPU软件栈:10月将结束封闭测试并开源,支持vLLM/SGLang,优化推测解码/KV缓存卸载等关键功能
- 模型适配:首发支持Qwen3.5 397B,后续扩展Kimi K3/GLM5.3等开放权重模型
- 文化优势:谷歌成熟的软件工程体系(对比AMD的测试优先文化)将加速外部生态成熟
3. 商业部署里程碑
- Anthropic案例:2029年前将部署超百万颗TPU(40万+直采+60万+GCP租赁),超越DeepMind内部用量
- 云服务策略:支持芯片直购与GCP租赁双模式,降低使用门槛
4. 技术深度优化
- 内核级创新:DP注意力优化、MoE路由优化、GDN内核填充减少
- 系统设计:FP8聚合服务实现质量/性能平衡,避免英伟达FP4的质量损失
行业启发与影响
- 算力市场格局重塑:TPU首次在推理领域形成对英伟达的实质性挑战,可能打破GPU垄断
- 开放模型生态催化:深度优化的开放权重模型支持策略,将加速行业向非英伟达平台迁移
- TCO竞争白热化:谷歌”内外双轨”经济性优化模式,迫使云厂商重新评估芯片战略
- 软件定义硬件趋势:TorchTPU的快速演进证明,成熟的软件栈比硬件峰值算力更能决定实际可用性
- AI基础设施新范式:TPUv7的推理专用设计(如KV缓存卸载)预示领域专用架构(DSA)的进一步分化
关键转折点:谷歌十余年TPU内部经验正转化为外部竞争优势,2024Q4开源后将迎来真正的市场检验。