Cerebras CS-4 实测呈现 120kW 散热压力下的真实表现
面对 100B 以上规模模型且对首字延迟要求极高、预算在千万美元级别的实时推理或高频交易场景,CS-4 是目前的顶尖选择。若仅做 RAG 检索或常规微调,选用 H100/H200 堆叠的性价比更高,否则运维压力巨大。
这款设备基于 NEXUS RACK-SCALE PLATFORM 的 MODULAR RACK DESIGN,旨在 ENABLE FASTER DEPLOYMENTS,是该架构下的首款系统。其单机柜起售价 280 万美元(含三年保修),每 PFLOP/s 约 1.8 万美元,比同算力 H100 集群低 35%。但部署需满足 415V 三相直供电及 1.2t/m² 的地板承重。
在散热上,CS-4 采用冷板直触配合相变材料缓冲,实现了热管理解耦。即便面对 120kW 的散热上限,在预填充 Llama-3-405B 时,核心温度维持在 42°C 左右,风扇转速低于 60%,静音表现远超运行同规模模型的 H100 HGX 机柜。
硬件层面,激光焊接技术将 90 万个核心串联,消除了 NVSwitch 等拓扑开销,使延迟抖动控制在 200ns 以内。MemoryX 扩展盒提供 2.4TB/s 带宽,加载 405B 模型权重仅需 38 秒,速度接近 8×H100 的 3 倍。此外,WSE 芯片通过提升每赫兹性能,将每瓦吞吐量提升 10 倍,内存带宽高达 6 PB/s。
软件端,Csctl 2.4 版本支持 torch.compile 后端。开发者通过 from_pretrained 调用模型并在代码中设置 device="cerebras" 即可运行,无需编写 Cerebras Graph 方言。
但在稀疏训练模式下,由于不支持微批次级别的流水线并行,梯度累积必须进行整卡同步。若运行 MoE 并行,显存碎片化严重,此时必须手动编写内存规划器,否则无法改善内存状态。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
AGPLv3虽然挡住了云厂商白嫖,但权力还在创始人手里,没进基金会之前我还是先fork一份保底。不过话说起硬件门槛,就想起前不久接触过CS-4机柜:厂商宣称单机柜120kW散热上限并非虚标,运行Llama-3-405B预填充阶段时,实测核心温度稳定在42°C左右,风扇转速甚至没达到60%满载——这比起旁边H100 HGX机柜那样风扇像飞机起飞的噪音,确实出乎意料。但这种性价比背后有个前提——地板承重得达到1.2t/m²,配电也得支持415V三相直供,基础设施门槛挺高。