Cerebras CS-4:三晶圆推理,一个核心疑问
Cerebras 首次将三颗餐盘大小的晶圆级处理器装入同一机架,声称推理速度比 GPU 系统快 30 倍。但几乎所有数字都是厂商自报,而芯片本身可能只是提频,并非新设计。
60 秒版本
Cerebras 发布 CS-4,首款多晶圆推理系统,将三颗 WSE-3 Turbo 处理器装入一机架,声称推理速度比 GPU 快 30 倍。
要点
- CS-4 搭载三颗 WSE-3 Turbo 晶圆,合计 750 PFLOPS 稀疏 FP16 算力、129.6 PB/s 内存带宽,支持 50 万亿以上参数模型。
- 所有核心性能数字——30 倍推理速度、1,000 tok/s、每瓦吞吐量 10 倍——均为厂商自报或内部外推,未经独立核实。
- WSE-3 Turbo 的晶体管数、核心数、SRAM 和 5 纳米节点与 WSE-3 相同;每晶圆算力恰好翻倍,符合时钟从约 1.4 GHz 提至 2.8 GHz 的特征,而非新芯片设计。
- CS-4 本季度开始出货,但未披露客户协议或定价;Cerebras 面临 2027 年必须推出真正新芯片的期限。
结论. 系统级工程成就显著,功耗优势有合理依据,但性能声明需要独立验证,芯片代际问题实为隐忧。
系统概述三颗晶圆装入一机架
Cerebras 于 8 月 18 日在 Supernova 活动上发布 CS-4,这是其首款将三颗晶圆级处理器整合在单一机架中的系统。该机专为推理设计——运行已训练模型生成响应,而非训练。发布距 OpenAI Ultrafast 模式上线仅五天,也是公司自 5 月以 55.5 亿美元纳斯达克上市以来首次硬件出货。
CS-4 采用全新 Nexus 机架级平台,组件比前代减少 50%。电源转换模块安装在后部可拆卸背包中,距处理器比传统 GPU 板卡近一百倍。晶圆间互连延迟从 5 微秒降至 2 微秒。
芯片疑问新设计还是提频?
WSE-3 Turbo 的 4 万亿晶体管、90 万核心、44 GB 片上 SRAM 和台积电 5 纳米节点与 WSE-3 完全相同。每晶圆算力和带宽恰好翻倍——这暗示时钟频率从约 1.4 GHz 提升至 2.8 GHz,而非微架构重新设计。The Register 在详细审查规格后认为这不是新芯片。Cerebras 已确认真正的新一代芯片计划于 2027 年推出。
| WSE-3 | 4 万亿晶体管、90 万核心、44 GB SRAM、5 nm、约 1.4 GHz |
|---|---|
| WSE-3 Turbo | 相同晶体管、核心、SRAM 和节点,约 2.8 GHz(算力/带宽翻倍) |
| CS-4 合计(3 颗) | 750 PFLOPS 稀疏 FP16、129.6 PB/s 带宽、2 µs 晶圆间延迟 |
数字解读速度声明,均为自报
Cerebras 称 CS-4 推理速度比 GPU 系统快 30 倍。该声明基于单一模型 gpt-oss-120b 对比未具名 GPU 配置测得。公司还称系统可在超过 10 万亿参数的模型上每秒维持 1,000 token 以上——该数字被标注为内部基准外推,非生产环境测量。
声称的每瓦吞吐量比 CS-3 高 10 倍同样基于内部外推。The Register 的独立估算认为 CS-4 每机架约 120 至 140 千瓦,约为可比 AMD 和 Nvidia 系统功耗的一半,使效率声明有了合理基础,尽管精确倍数尚无第三方验证。
架构设计解耦推理与 Nexus 平台
CS-4 支持解耦推理架构:由独立预填充平台(如 AMD Helios 或 AWS Trainium)处理提示词,Cerebras 系统负责超低延迟解码阶段。运营商可在预填充阶段使用 GPU 或 ASIC 基础设施,在 token 生成阶段切换至 Cerebras。
新 Nexus 机架平台围绕模块化计算、电源和 I/O 组件构建。计算子系统使用垂直安装的晶圆级背包,将处理器与电源分离,简化制造并缩短部署时间。I/O 子系统同时支持基于 RoCE v2 RDMA 以太网的标准连接和用于免交换机互连的直连晶圆链路。
商业背景上市后首款硬件,财务喜忧参半
Cerebras 在发布的同时提到了 OpenAI、G42、MBZUAI 和 AWS 等合作伙伴,但未披露任何 CS-4 客户协议或定价。CTO Sean Lie 将速度论据直接指向智能体工作负载:推理快 30 倍,他说,意味着智能体系统可以有十倍以上的推理、验证或工具调用空间。
收入集中度仍是结构性隐忧。G42 和阿联酋穆罕默德·本·扎耶德人工智能大学合计占 2025 年收入约 86%。OpenAI 合同(签约时价值超 100 亿美元)是公司应对集中的主要手段。第二季度新增客户包括 Cognition、Lovable、CrowdStrike、Block 和 Figma。
CS-4 首批出货本季度完成。真正的考验在 2027 年,届时新一代芯片必须用新设计而非更快时钟来证明自己。
结论真实系统、未核实数字、芯片争议
CS-4 是真正的工程成就:三颗晶圆级处理器装入单一机架,配以模块化平台、低延迟互连和独立分析师认为合理的功耗架构。但所有核心性能数字均为厂商自报,而芯片本身可能只是提频而非新设计。此次发布为 Cerebras 提供了面向推理市场的产品,但决定性的证据——第三方基准测试、客户部署和实际能效——尚未到来。