精华简报:AgentX 1.0 与智能体推理基准——CUDA 护城河是否依然牢固?
来源:SemiAnalysis
文章:AgentX - InferenceXv3: Does CUDA Moat Hold up in Agentic Inferencing?
链接:https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
一、背景与动机
自 2025 年 11 月 Claude Code 拐点 以来,长上下文、多轮智能体(agentic)工作负载迅速增长,已主导生产推理流量。2026 年 4 月,OpenAI 企业智能体支出首次超过 ChatGPT 支出,标志着智能体工作流正式成为主流。
然而,传统 AI 推理基准大多基于固定序列长度的 prefill/decode 场景,无法反映真实智能体负载的特征:多轮交互、长上下文、高 prefill 重用、子智能体突发、KVCache 卸载、大量工具调用等。为此,SemiAnalysis 推出 AgentX 1.0,旨在建立行业衡量 AI 硬件与软件性能的“正确方法”。
二、AgentX 1.0 核心要点
- 定位:全球首个完全开源、多轮智能体编码推理基准,支持 100 万上下文,以 Apache 2.0 许可证发布。
- 投入:数据集构建花费超过 300 万美元,全部开源。
- 场景设计:InferenceXv3 在原有固定序列长度场景(8k1k、1k1k、1k8k)之外,新增 AgentX 场景,用真实智能体编码流量取代单轮 8k 输入/1k 输出 token 的旧模式。
- 测试规模:完整矩阵运行在约 2MW 持续计算上,覆盖 超过 1000 个芯片,包括 MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro 服务器等 SKU。Rubin 将于本月晚些时候加入,TPU 和 Mi455X UALoE72 将于今年晚些时候加入。
- 方法论真实性:基准配置主要跟踪
recipes.vllm.ai和 SGLang cookbook 的上游镜像,测量实际客户体验的性能,而非针对基准测试最大化优化的“benchmax”镜像。
三、初步性能观察
文章未给出具体性能数据,但定性结论明确:
- NVIDIA 与 AMD 均表现强劲。
- NVIDIA 在许多前沿模型上表现非常好。
- AMD 在某些前沿模型的特定比较中也表现良好。
这意味着在智能体推理场景下,AMD 已具备一定竞争力,但 NVIDIA 仍保持整体领先。文章标题提出的“CUDA 护城河是否牢固”并未给出二元答案,但信号显示:CUDA 护城河正在从“不可逾越”转向“需在具体场景中验证”。
四、行业影响与开源生态
AgentX 在发布初期最大的价值并非初步结果,而是已经产生的巨大行业影响:
- 超过 70 个上游 PR 已合并或提交,覆盖 vLLM、SGLang、TensorRT-LLM、ATOM、AITER、Dynamo、LMCache、Mooncake 等主流推理框架/库。这些优化大多可迁移至生产流量,AgentX 已成为事实上的“北极星基准代理”。
- 开源深度:除基准本身外,还开放了前端、公共数据库(通过 REST API 提供,多个一级 AI 实验室的容量规划团队已在消费)、GitHub Actions CI 来源、日志以及每个数据点的准确性验证。
- 生态协作:感谢 Inferact/vLLM、RedHat/llm-d、RadixArk/SGLang、LMCache/TensorMesh 等 OSS 合作伙伴的贡献。
五、后续展望
- 三到四周内将发布 AgentX 更新文章,涵盖进一步优化及 AMD/NVIDIA 最新性能结果。
- 智能体工作负载特征更新迅速,InferenceX 将继续快速迭代基准以跟踪相关负载。
- 测试矩阵将扩展至 Rubin、TPU、Mi455X UALoE72 等新硬件。
六、分析师简评
- 基准范式转移:AgentX 的推出标志着 AI 推理评估从“静态序列长度”转向“真实智能体流量”,这对硬件采购、软件优化和模型部署决策具有深远影响。
- CUDA 护城河承压但未崩塌:NVIDIA 仍在前沿模型整体表现上占优,但 AMD 在特定智能体场景中已展现竞争力。开源基准和上游优化的普及,正在降低硬件锁定效应,使非 NVIDIA 方案更容易被验证和采用。
- 软件栈重要性上升:智能体负载对 KVCache 管理、调度、prefill 重用等软件能力要求极高。超过 70 个上游 PR 表明,软件优化正在成为比硬件峰值算力更关键的竞争维度。
- 开源生态的战略价值:SemiAnalysis 通过开源数据集、数据库和 CI 流程,正在构建一个行业级标准,其影响力可能超越单次基准结果本身。
一句话总结:AgentX 1.0 重新定义了智能体推理的衡量方式,初步结果显示 NVIDIA 仍领先但 AMD 正在特定场景缩小差距;CUDA 护城河在智能体时代面临更多变量,开源软件生态和真实工作负载优化将成为下一阶段竞争的核心。