Cerebras CS-4:三晶圆推理,一个核心疑问

Cerebras 首次将三颗餐盘大小的晶圆级处理器装入同一机架,声称推理速度比 GPU 系统快 30 倍。但几乎所有数字都是厂商自报,而芯片本身可能只是提频,并非新设计。

✓ 已核实 来源 Cerebras Systems official announcement, cross-checked against TNW and The Register reporting ⚑ AI基础设施

60 秒版本

Cerebras 发布 CS-4,首款多晶圆推理系统,将三颗 WSE-3 Turbo 处理器装入一机架,声称推理速度比 GPU 快 30 倍。

要点

  • CS-4 搭载三颗 WSE-3 Turbo 晶圆,合计 750 PFLOPS 稀疏 FP16 算力、129.6 PB/s 内存带宽,支持 50 万亿以上参数模型。
  • 所有核心性能数字——30 倍推理速度、1,000 tok/s、每瓦吞吐量 10 倍——均为厂商自报或内部外推,未经独立核实。
  • WSE-3 Turbo 的晶体管数、核心数、SRAM 和 5 纳米节点与 WSE-3 相同;每晶圆算力恰好翻倍,符合时钟从约 1.4 GHz 提至 2.8 GHz 的特征,而非新芯片设计。
  • CS-4 本季度开始出货,但未披露客户协议或定价;Cerebras 面临 2027 年必须推出真正新芯片的期限。

结论. 系统级工程成就显著,功耗优势有合理依据,但性能声明需要独立验证,芯片代际问题实为隐忧。

系统概述三颗晶圆装入一机架

Cerebras 于 8 月 18 日在 Supernova 活动上发布 CS-4,这是其首款将三颗晶圆级处理器整合在单一机架中的系统。该机专为推理设计——运行已训练模型生成响应,而非训练。发布距 OpenAI Ultrafast 模式上线仅五天,也是公司自 5 月以 55.5 亿美元纳斯达克上市以来首次硬件出货。

3每机架 WSE-3 Turbo 晶圆数量
750 PFLOPS合计稀疏 FP16 算力(⚑ 厂商规格)
129.6 PB/s聚合内存带宽(⚑ 厂商规格)
50万亿+参数模型支持(⚑ 厂商声称)

CS-4 采用全新 Nexus 机架级平台,组件比前代减少 50%。电源转换模块安装在后部可拆卸背包中,距处理器比传统 GPU 板卡近一百倍。晶圆间互连延迟从 5 微秒降至 2 微秒。

芯片疑问新设计还是提频?

WSE-3 Turbo 的 4 万亿晶体管、90 万核心、44 GB 片上 SRAM 和台积电 5 纳米节点与 WSE-3 完全相同。每晶圆算力和带宽恰好翻倍——这暗示时钟频率从约 1.4 GHz 提升至 2.8 GHz,而非微架构重新设计。The Register 在详细审查规格后认为这不是新芯片。Cerebras 已确认真正的新一代芯片计划于 2027 年推出。

WSE-34 万亿晶体管、90 万核心、44 GB SRAM、5 nm、约 1.4 GHz
WSE-3 Turbo相同晶体管、核心、SRAM 和节点,约 2.8 GHz(算力/带宽翻倍)
CS-4 合计(3 颗)750 PFLOPS 稀疏 FP16、129.6 PB/s 带宽、2 µs 晶圆间延迟

数字解读速度声明,均为自报

Cerebras 称 CS-4 推理速度比 GPU 系统快 30 倍。该声明基于单一模型 gpt-oss-120b 对比未具名 GPU 配置测得。公司还称系统可在超过 10 万亿参数的模型上每秒维持 1,000 token 以上——该数字被标注为内部基准外推,非生产环境测量。

声称的每瓦吞吐量比 CS-3 高 10 倍同样基于内部外推。The Register 的独立估算认为 CS-4 每机架约 120 至 140 千瓦,约为可比 AMD 和 Nvidia 系统功耗的一半,使效率声明有了合理基础,尽管精确倍数尚无第三方验证。

架构设计解耦推理与 Nexus 平台

CS-4 支持解耦推理架构:由独立预填充平台(如 AMD Helios 或 AWS Trainium)处理提示词,Cerebras 系统负责超低延迟解码阶段。运营商可在预填充阶段使用 GPU 或 ASIC 基础设施,在 token 生成阶段切换至 Cerebras。

Nexus 机架平台围绕模块化计算、电源和 I/O 组件构建。计算子系统使用垂直安装的晶圆级背包,将处理器与电源分离,简化制造并缩短部署时间。I/O 子系统同时支持基于 RoCE v2 RDMA 以太网的标准连接和用于免交换机互连的直连晶圆链路。

商业背景上市后首款硬件,财务喜忧参半

Cerebras 在发布的同时提到了 OpenAI、G42、MBZUAI 和 AWS 等合作伙伴,但未披露任何 CS-4 客户协议或定价。CTO Sean Lie 将速度论据直接指向智能体工作负载:推理快 30 倍,他说,意味着智能体系统可以有十倍以上的推理、验证或工具调用空间。

1.801 亿美元2026 年 Q2 收入,同比增长 74%,但环比下降(Q1 为 1.934 亿)
4.505 亿美元Q2 GAAP 净亏损
约 86%2025 年收入来自 G42 和 MBZUAI
超 100 亿美元2026 年 1 月签署的 OpenAI 合同(签约时价值)

收入集中度仍是结构性隐忧。G42 和阿联酋穆罕默德·本·扎耶德人工智能大学合计占 2025 年收入约 86%。OpenAI 合同(签约时价值超 100 亿美元)是公司应对集中的主要手段。第二季度新增客户包括 Cognition、Lovable、CrowdStrike、Block 和 Figma。

CS-4 首批出货本季度完成。真正的考验在 2027 年,届时新一代芯片必须用新设计而非更快时钟来证明自己。

结论真实系统、未核实数字、芯片争议

CS-4 是真正的工程成就:三颗晶圆级处理器装入单一机架,配以模块化平台、低延迟互连和独立分析师认为合理的功耗架构。但所有核心性能数字均为厂商自报,而芯片本身可能只是提频而非新设计。此次发布为 Cerebras 提供了面向推理市场的产品,但决定性的证据——第三方基准测试、客户部署和实际能效——尚未到来。