Cerebras 那块盘子大的芯片真能打赢 H100 吗?
但看完演示我反而更清醒了。第一、软件栈还是个大坑。 视频演示全是 PyTorch 原生模型一键编译,实际落地要是遇到自定义算子、动态 shape、或者 MoE 路由逻辑,SDK 能不能搞定还是个谜;Nvidia 的 CUDA 生态和 Triton/TensorRT-LLM 打磨了多少年,迁移成本不是吹的。第二、买得起也用不起。 一套 CS-3 系统几百万美金起步,还得配专用水冷机柜、专用电源,机房改造预算能再买一堆 HGX H100。对于 99% 只跑 7B/70B 模型的中小厂,这属于「核弹炸蚊子」。
第三、规模化扩展逻辑不一样。 Nvidia 靠 NVLink/NVLink Switch 做 Scale-up,再用 InfiniBand/RoCE 做 Scale-out,拓扑灵活;Cerebras 走 MemoryX/SwarmX 走专用协议,一旦单系统 1.2PB 内存不够用,扩展节点的边际成本和工程复杂度指数级上升。
视频结尾演示的「同等功耗下吞吐碾压 H100 10 倍」很漂亮,但那是理想条件下的稠密矩阵乘法。真实业务里混着 Attention、LayerNorm、All-Reduce、预填充/解码不均衡负载,WSE 的流水线调度器能不能压榨出同等比例的效率,我还是想看第三方跑开源 vLLM/SGLang 基准测试的数据,而不是厂商自家的 PPT 跑分。
所以结论很清楚:在超长上下文、超大模型(400B+)、极致低延迟推理这几个极窄赛道,Cerebras 是降维打击;但在通用训练、中小模型推理、生态兼容性、TCO 可控性上,Nvidia 目前依然没对手。 除非你是做实时语音对话、高频交易风控、或者国家级超算中心,否则老老实实攒 H100/H200 甚至等 B200 才是正解。
这行业半年一大版本,一年换个架构,文档还没写完就过期了