精华简报:NVIDIA GPU 上的超高交互性?——TileRT InferenceX
📌 TL;DR(核心主旨)
传统 GPU 在高吞吐推理中表现优异,但在超低延迟(超高交互性)场景下受限于 Kernel 启动/同步开销与内存延迟瓶颈,远未达到 HBM 带宽的理论上限。TileRT 通过将整个解码图静态编译为单一持久化 Kernel,在不更换硬件的前提下,将 NVIDIA B200 上的单用户解码速度推至 340–500 tokens/s/user——比 GB300 NVL72 传统引擎快 1.9–3.6 倍,同时以牺牲总吞吐量和并发度为代价,切入了一个由 Cerebras、Groq LPU 等专用芯片主导的细分市场,并有潜力凭借“纯软件方案”蚕食其 TAM。
🔍 核心观点与技术/商业洞察
1. 市场信号:低延迟正在成为“溢价定价权”的来源
- 高溢价“快速模式”已证明用户愿意为更低延迟和更快 Token 支付更多费用,这意味着交互性本身正在成为毛利率的驱动因素。
- OpenAI 等前沿实验室正在评估 Cerebras、Groq LPU 等专用推理系统——它们优先保证“超高交互性”而非最大批量吞吐。
- 典型场景:GPT-Live 的全双工语音(同时听和说),延迟可被用户即时感知,体验对标“钢铁侠的 JARVIS”。
2. GPU 的“隐性瓶颈”:不是带宽,而是延迟
- 理论极限 vs 现实:8×GPU HGX B200 聚合 HBM 带宽 64 TB/s,在 batch size 1 下 GLM-5 NVFP4 理论上可达 3,047 tokens/s/user,但实践中远未接近。
- 根因①:Kernel 启动/同步开销——传统 GPU 编程模型反复 launch/sync 大量独立 Kernel,即使使用 CUDA Graphs,当 TPOT(每输出 Token 时间)逼近亚毫秒级时,固定开销占据主导。
- 根因②:内存延迟停滞不前——带宽每代提升 2–3 倍,但内存延迟几乎没有改善。
3. TileRT 方案:用“持久化引擎”重塑 GPU 执行模型
- 核心机制:将整个解码图静态编译为单一持久化 Kernel,最大化计算、内存读写与通信之间的重叠,从根本上消除 Kernel 间切换的固定成本。
- 性能验证(InferenceX 基准) :
- 8K/1K 输入输出:B200 八卡节点达 340 tokens/s/user,较此前最佳(GB300 NVL72 NVFP4+MTP,181.4)快 1.9×;较最佳 FP8 结果(B300 MTP,113.6)快 3.0×。
- 1K/1K 输入输出:达 494.2 tokens/s/user,为最佳 FP4 结果(256.3)的 1.9×、最佳 FP8 结果(136.3)的 3.6×——且 TileRT 尚未支持 FP4。
- 端到端延迟:解码尾部 3.01 秒,对比最佳 NVFP4+MTP 竞品 6.54 秒、MI355X 18.18 秒。
- 等成本比较:单 B200 解码服务器的 TileRT 比 GB300 NVL72 传统引擎快约 3×(500 vs 传统);等成本下快 2×。
4. 权衡与边界:不是万能的“免费午餐”
- 吞吐量让渡:TileRT 在 8K/1K 下总吞吐 160.4 tokens/s/GPU(340 tok/s/user),而 GB300 FP4+MTP 并发 12 时总吞吐约 240 tokens/s/GPU(154 tok/s/user)——单用户速度 vs 聚合效率的取舍依然存在。
- 当前仅支持 batch size 1:每个解码节点仅服务一个在途请求,属于“私人火箭飞船”式的极端专业化运行点,而非通用吞吐配置。支持多并发是其未来雄心但也是巨大工程挑战。
- 明确的分工定位:通过 PD 分离(Prefill-Decode Disaggregation) ,TileRT 专职处理延迟敏感的解码,vLLM/SGLang 继续负责预填充——两者互补而非替代。已落地:小米 MiMo V2.5 Pro UltraSpeed、ZAI GLM 5.1 HighSpeed 生产环境。
5. 生态与行业背景
- TileRT 来自 TileLang DSL 同一维护者组织,兼容 vLLM V1 connector,降低集成门槛。
- InferenceX 为开源、供应商中立的基准平台,已获 Google Cloud、Azure、Oracle、Meta 等买方及 OpenAI、MiniMax、ZAI 等实验室的验证/支持。
- Nvidia 已承诺提交可验证的 Vera Rubin 数据;Google TPUv7、AMD MI455X UALoE72 结果即将发布。
🌐 行业启发与影响
1. GPU 的“延迟下限”被重估,软件优化的价值被重新定价。 TileRT 证明:GPU 与专用芯片之间的延迟差距并非不可逾越的硬件鸿沟,通过静态编译与持久化内核即可在不更换硬件的条件下实现数量级的交互性提升。这直接动摇了“超低延迟必须买专用芯片”的市场假设。
2. 对 Cerebras / Groq LPU / SambaNova 等专用芯片的 TAM 构成实质性威胁。 如果 GPU+TileRT 能以更低的总拥有成本覆盖“高交互性”需求(尤其在等成本条件下快 2×),数据流芯片的差异化护城河将收窄——其生存空间可能被压缩至 GPU 根本无法触及的极端延迟区间(如亚毫秒级 TPOT)。
3. 推理架构走向“分工专业化”而非“单引擎通吃”。 PD 分离 + 混合引擎(专用解码引擎 + 吞吐优化引擎)正在成为生产级推理的标准范式。这预示着未来推理栈将更像“异构计算编排”:不同阶段由不同引擎服务,按延迟/吞吐需求动态路由。
4. “交互性”将成为一个独立的定价与产品维度。 正如“快速模式”已验证付费意愿,超高交互性正从技术指标演变为商业分层工具——AI 产品的“响应速度”正成为类似“座位等级”的差异化定价杠杆。
5. 基准测试的话语权竞争白热化。 InferenceX 这类开放、可复现、供应商中立的基准平台正在成为行业“裁判”,对采购决策和技术路线选择的影响力日益增强。Nvidia、AMD、Google 的主动“提交数据”行为,标志着硬件厂商已从“自报指标”转向“第三方验证”的新竞争阶段。
来源:SemiAnalysis — Ultra-High Interactivity on NVIDIA GPUs? - TileRT InferenceX