Cerebras CS-4 在 WSE-3 上性能翻倍

The Decoder··作者 Maximilian Schreiner

关键信息

Cerebras 表示,单个 CS-4 机架可容纳三片晶圆,而不是两片,并且每位用户最高可达到 4,400 tokens/s,公司称这比基于 Nvidia GPU 的方案快高达 30 倍。每片晶圆的内存容量仍为 44 GB,同时公司还在通过 AMD 和 AWS Trainium 推进解耦推理合作,不过 SemiAnalysis 认为网络方面的收益相对有限。

资讯摘要

Cerebras 发布了最新的 AI 加速系统 CS-4,首席执行官 Andrew Feldman 将其称为业界最快的系统。CS-4 属于机架级产品,也就是说它不是单独的一块芯片或一台服务器,而是作为完整的机柜交付到数据中心,电力、散热和计算都集成在同一套系统中。与新一代芯片发布不同,CS-4 仍然基于与 CS-3 相同的 5nm WSE-3 晶圆级引擎。Cerebras 说,CS-4 之所以能把性能提升到 CS-3 的两倍,主要是通过更高的主频实现,而更高主频又来自更强的供电和更好的散热。公司还表示,机架设计也发生了变化:一个 CS-4 机架现在可容纳三片晶圆,而之前是两片。

按照 Cerebras 的说法,这种配置可为每位用户提供最高 4,400 tokens/s,并且相较于基于 Nvidia GPU 的系统可快达 30 倍。每片晶圆的内存容量仍然是 44 GB,因此这次提升看起来主要来自系统层面的优化,而不是更大的内存。Cerebras 还采用了新的模块化“Backpack”设计来加快组装,并通过 AMD 和 AWS Trainium 等合作伙伴推进解耦推理。公司表示,更多技术细节将在 Hot Chips 大会上公布,而其硬件已经被 OpenAI 用于 Codex Spark。

Cerebras CS-4 在 WSE-3 上性能翻倍

资讯正文

Cerebras发布了CS-4,单颗芯片性能翻倍

Cerebras推出了其CS-4 AI加速器,首席执行官Andrew Feldman称其为业内最快的系统。CS-4是一款机架级产品,这意味着它以完整服务器机柜的形式进入数据中心,作为一个单一单元交付,配备计算单元、电源和散热系统。

CS-4仍然采用5nm WSE-3芯片,但通过增加功耗和改善散热来提升时钟速度,使早先的CS-3性能翻倍。现在一个机架可容纳三片晶圆,而不是两片,并且为每位用户提供最高4,400 tokens per second。Cerebras表示,这比运行在Nvidia GPU上的方案快高达30倍。每片晶圆的内存容量仍为44 GB。

Cerebras正在采用一种新的模块化“Backpack”设计,以加快组装,同时通过AMD和AWS Trainium等合作伙伴提供解耦推理。SemiAnalysis的分析师认为,网络方面的提升相当有限。更多细节将于Hot Chips大会上公布。Cerebras的硬件被OpenAI用于Codex Spark等产品。

来源与参考

  1. 原始链接
  2. Cerebras unveils CS-4 with double the performance on the same chip

收录于 2026-08-25