Cerebras CS-4三晶圆并联 宣称推理速度超GPU三十倍

2026年8月18日,Cerebras发布CS-4推理系统。该系统由三枚WSE-3 Turbo晶圆并联构成,官方数据显示其在万亿参数以上模型上每秒可输出逾1000 token,较GPU方案快最多30倍,单瓦吞吐较前代CS-3提升10倍。

分解式架构的具体设计

CS-4采用Nexus机架级平台,晶圆间通信延迟降至2微秒,支持超过50万亿参数模型。系统总算力达750 PFLOPs,内存带宽129.6 PB/s,晶圆间I/O带宽7.2 Tbps。

在AI领域,速度即生产力。Cerebras CS-4在最大前沿模型上提供行业领先速度,从根本上改变了范式。——Andrew Feldman,Cerebras CEO兼联合创始人

与OpenAI合作推出GPT-5.6 Sol Ultrafast模式,速度为标准模式的14倍;与AMD合作分解式推理架构,由AMD Helios负责Prefill阶段,Cerebras负责Decode阶段,综合吞吐再提升5倍。

推理基础设施的实际影响

分解式架构将Prefill与Decode分离,理论上可提升整体吞吐。CS-4的低延迟晶圆间互联针对跨厂商协调的网络延迟和功耗分配问题做了优化。

单瓦吞吐提升10倍意味着相同功耗预算下可产生更多token。这直接影响数据中心盈利能力,尤其在需要高交互体验的agentic应用场景。

  • 开发者可获得响应更快的推理服务,适合实时推理和多轮对话。
  • 运营商在固定功率约束下获得更高总吞吐。
  • 新进入者可通过模块化机架快速扩容,降低前期硬件门槛。

深层原因分析

英伟达长期主导推理市场,源于CUDA生态和成熟软件栈。Cerebras选择晶圆级集成路径,绕过传统GPU的多芯片互联瓶颈,核心在于解决大规模模型下的通信延迟。AMD合作则显示其试图构建异构方案,而非孤立竞争。

该策略的深层驱动是前沿模型参数规模持续增长,单一加速器已难以维持交互速度。CS-4的2微秒晶圆间延迟正是针对此痛点。

独立判断

CS-4提供了可量产的硬件选项,性能数据有具体来源支撑。其与OpenAI和AMD的合作显示商业落地意图。开发者在选择部署方案时,应优先参考实际API稳定性和总拥有成本,而非仅看峰值速度宣传。