Cerebras CS-4 精华简报
来源:SemiAnalysis
标题:Cerebras’s Next Generation CS-4: Fast Just Got Faster
链接:https://newsletter.semianalysis.com/p/cerebrass-next-generation-cs-4-fast
TL;DR
Cerebras 发布第四代机架系统 CS-4,核心策略是“同一块 WSE-3 晶圆,榨出双倍性能”:通过大幅提升供电与冷却能力,将时钟频率翻倍,从而使片上内存带宽、片外 I/O 和 tokens/s/user 均接近翻倍,而成本与上一代 CS-3 大致相当;同时机架改为模块化“背包”设计,每机架可容纳 3 个晶圆引擎,并新增可现场升级的 I/O 模块,为异构解耦推理铺路。但 SRAM 容量仍被锁定在 44GB,网络延迟虽有改善却依然限制并行策略,性能/瓦提升也相对有限。
核心观点与技术/商业洞察
1. 同一晶圆,双倍时钟:用功耗换性能
- CS-4 沿用与 CS-3 相同的 5nm WSE-3,但通过改进供电与冷却技术,将时钟速度翻倍。
- 由此带来:
- 内存带宽翻倍:这是对推理吞吐最关键的指标,直接推动 tokens/s/user 接近翻倍。
- 理论峰值 FLOPs 翻倍。
- 片外 I/O 从 1.2Tb/s 提升至 2.4Tb/s。
- 代价与短板:
- 每晶圆 SRAM 容量仍为 44GB,因为该容量由晶圆上 SRAM 位单元数量决定,必须等待下一代硅片才能提升。
- 低内存容量是 Cerebras 晶圆架构固有的核心权衡,也是其无法独立承载超大模型权重的原因。
2. 网络改进:更低延迟,但仍有限制
- 新晶圆 I/O 接口采用升级版 FPGA 卡,作为 NIC 将 Cerebras 专有 I/O 转换为标准以太网。
- I/O 模块现场可升级:无需重新设计机箱即可适配新网络标准,这为与外部系统集成提供了灵活性。
- 网络延迟优化:
- 2 层胖树网络(Arista 交换机)延迟从 5μs 降至 3μs。
- 新增可配置的晶圆到晶圆直连路径,延迟进一步降至 2μs。
- 分析师判断:
- 尽管是真实改进,但竞争对手已在引用纳秒级交换机延迟,3μs 仍构成瓶颈。
- 该延迟与带宽限制使得专家并行(EP)和专家张量并行(ETP)仍不可行,因为 token 分发/合并对延迟过于敏感,且存在专家不均衡问题。
- 因此流水线并行仍是唯一现实方案。
3. “背包式”机架:模块化、可插拔、降本增效
- 机架被拆分为:
- 前半部分:专门负责供电。
- 后半部分:专门负责计算,以模块化“背包”形式呈现。
- 每个背包容纳一个 WSE-3,每个 CS-4 机架可装 3 个晶圆引擎(CS-3 为 2 个)。
- 冷却基础设施(泵、热交换器)被移出机架,适配现代全液冷数据中心。
- 背包内部将电源、冷却、I/O、WSE-3 模块独立拆分,大幅简化制造与部署:客户可先部署电源模块,现场再“插拔”晶圆背包。
- 功耗与能效:
- 单个 CS-4 机架 TDP 为 125–135kW,约为单个 CS-3(23kW)的两倍。
- 性能/瓦最多只有轻微提升,并非能效飞跃。
- 成本竞争力:
- 虽然更多供电和冷却会推高 BOM,但组件减少和组装简化可显著抵消。
- 分析师预计每晶圆有效 BOM 与 CS-3 相近,客户以相似 TCO 获得近乎双倍的 token 收入。
4. 营销数字与真实性能
- Cerebras 主推 43 PB/s 片上总内存带宽,号称约为 NVIDIA Rubin 的 2000 倍。
- 但实际交互性提升,Cerebras 自己给出的更保守数字是“最高 30 倍”。
- SemiAnalysis 估算:
- CS-4 在前沿模型上可达到 接近 4,000 tok/sec/user。
- CS-3 为 2,000 tok/sec/user。
- Blackwell GPU 理论极限约 200 tok/sec/user,实际合理并发下约 100 tok/sec/user。
- 因此实际交互性差距约为 20–40 倍,而非 2000 倍。
5. 并行策略:容量约束决定路线
- 由于 WSE 片上 SRAM 不足以容纳整个模型权重,Cerebras 继续押注流水线并行推理。
- 在 CS-4 上,MoE 模型的每个专家都交错放在单个晶圆上,无需跨晶圆分片专家。
- 与 GPU 主流策略(张量并行 + 专家并行)形成鲜明对比。
- 长上下文成本问题:
- KV Cache 的内存需求随并发用户数和上下文窗口长度线性增长。
- 分析师预计 Cerebras 客户(如 OpenAI)可能以 256k 而非 1M 上下文运行前沿模型(如 GPT 5.6 Sol),以控制 KV Cache 占用的片上存储成本。
对行业的启发与影响
1. 高交互性推理正在成为独立战场
- CS-4 明确锁定“高交互性、低吞吐量”的推理细分市场。
- 这迫使 NVIDIA 等巨头必须正视该场景:SemiAnalysis 特别提到 NVIDIA 的 TileRT,正是将高交互性/低吞吐量配置引入 GPU 集群的回应。
- 内存带宽的数字宣传与实际可用 tokens/s/user 之间存在巨大鸿沟,行业评估应更多基于端到端性能和 TCO。
2. 解耦推理架构将成为主流趋势
- CS-4 的新型 I/O 模块支持开放、异构、解耦的推理架构:可将 CS-4 与基于 HBM 的 XPU 配对,形成“注意力 + 前馈网络”的解耦推理系统,从而弥补 CS-4 低内存容量的短板。
- 这与 NVIDIA 对 Groq LPU 的定位逻辑一致,也暗示为 AWS 等云厂商定制:AWS 希望将 EFA NIC 放在 CS-4 上,与 Trainium 服务器协同工作。
- 未来推理系统可能不再是一台设备包打天下,而是“低容量高带宽设备 + 大容量 HBM 设备”的分工组合。
3. 模块化设计决定部署速度与商业吸引力
- 机架级模块化、现场可升级 I/O、插拔式晶圆背包,正在成为 AI 硬件工程的重要方向。
- 更快的部署时间 + 相近 TCO + 双倍 token 收入,使 CS-4 对现有 Cerebras 客户成为“无需思考”的升级。
- 但功耗与散热挑战也在加剧:125–135kW 机架要求数据中心具备全液冷能力,这会筛选客户类型。
4. 架构固有瓶颈依然存在
- 44GB SRAM 容量限制、3μs 网络延迟、性能/瓦仅小幅提升,意味着 CS-4 是“同代硅片上的极限榨取”,而非代际突破。
- 长期竞争力仍取决于下一代晶圆级引擎能否在容量、互连和能效上取得实质性进步。
- 短期内,Cerebras 必须依赖解耦推理生态来弥补容量劣势,这既是机会,也是风险。
一句话总结:CS-4 是 Cerebras 在现有 WSE-3 架构上的一次高效工程化升级——用功耗换性能、用模块化换成本、用开放 I/O 换生态兼容,在高交互性推理领域进一步拉开与 GPU 的体验差距,但架构固有的内存容量和网络延迟瓶颈,决定了其长期天花板仍需下一代硅片来打破。