Cerebras CS-3 为何能以 90 万核心「挑战」H100:技术突破与现实鸿沟
Cerebras CS-3 宣布搭载 4 万亿晶体管(超越当前最大 GPU 的 57 倍),并以 2x 速度超越前代 CS-2 —— 这意味着在 2024 年,一颗芯片的算力密度已经不再遵循 1972 年诞生以来的摩尔定律(每 2 年 晶体管数量翻倍),而是通过 2019 年 推出的 Wafer-Scale Engine(WSE)技术打破了行业规则。而 WSE-3 的核心设计 —— 90 万个核心 + 44GB 片上 SRAM —— 让其能够将 KV Cache 完全内置,彻底绕过 H100 依赖 HBM 的数据搬运瓶颈。这意味着在 超长上下文(405B 以上) 和 极低延迟推理 场景下,CS-3 的 2000+ tokens/s 速度并非单纯靠算力堆叠,而是通过 存算一体 将通信开销降至零。
不过,技术突破并不等同于生态兼容。CS-3 的 SDK 成熟度 尚未经过 自定义算子、动态 shape 或 MoE 路由 的验证,而 Nvidia 的 Triton/TensorRT-LLM 已经积累 5 年(自 2019 年问世)的工程实践,迁移成本远高于硬件采购费用。此外,CS-3 的 MemoryX 扩展方案 虽然单系统可达 1.2PB 内存,但 Scale-out 时的边际成本与复杂度却与 Nvidia 的 NVLink+InfiniBand 路线形成鲜明对比 —— 前者在 超大规模集群 时,每增加一节点的工程门槛都会 指数级 上升。
Condor Galaxy 3 —— 由 G42 合作打造的首台 CS-3 云原生超算 —— 将于 2024 年第二季度 交付使用,这意味着 CS-3 已经进入 商业化阶段,但其 总拥有成本(TCO) 依然难以被中小型企业接受:一套系统起价 几百万美元,且需配备 专用水冷机柜与电源,无法直接接入标准机房。对于 99% 仅使用 7B/70B 模型 的用户来说,“核弹炸蚊子” 的性价比问题依然存在。
在 真实业务场景 下,WSE-3 的 流水线调度器 是否能维持 10 倍 H100 吞吐量 还待 vLLM/SGLang 等第三方基准测试 验证,因为 Attention、LayerNorm 以及 Prefill/Decode 不均衡负载 会显著影响实际性能。除非你的应用场景是 实时语音对话、高频交易风控或国家级超算中心,否则 H100/H200 仍是更稳妥的选择。而 undefined 的到来,可能会进一步拉近两者在 通用推理 上的差距。
全部回复 (4)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
2000 token/s 确实猛,但机房风冷要是扛不住,这功耗直接让电表烧掉吧?看过 Cerebras CS-3 跑 Llama 3.1 405B 的演示视频,Token 生成速度直接冲上 2000+ tokens/s,这数字放在现在的单节点 H100 集群里基本属于不敢想的级别。靠着 90 万个核心配合 44GB 片上 SRAM,直接把 KV Cache 全塞进芯片里头,这精准击中了 LLM 推理最硬的痛点——内存墙。
batch=1 跑 2000 速度快有什么用,真把并发拉起来估计得卡死。除非把 KV Cache 完全塞进 WSE‑3 的 44 GB 片上 SRAM,才能真正利用那 2000 tokens/s 的低延迟优势。
单芯片跑出 2000 tokens/s 确实令人惊叹,H100 这种堆算力的打法在 Cerebras 面前确实像在用算盘!看过 Cerebras CS-3 跑 Llama 3.1 405B 的演示视频,Token 生成速度直接冲上 2000+ tokens/s,这数字放在现在的单节点 H100 集群里基本属于不敢想的级别。靠着 90 万个核心配合 44GB 片上 SRAM,直接把 KV Cache 全塞进芯片里头,这精准击中了 LLM 推理最硬的痛点——内存墙。H100 还得靠 HBM 搬运数据,WSE-3 走的是存算一体路线,彻底砍掉了芯片与内存间来回折腾的通信开销。在极致低延迟推理这个维度上,Cerebras 确实是对 Nvidia 来了一记降维打击。
直接把WSE-3的存算一体路线甩面试官脸上,看他怎么解释为何H100还得靠HBM搬运数据。