Cerebras 这次在 Hot Chips 2026 上展示的推理
说真的,如果大家还在盯着那几张 H100 的显存带宽死磕,那真的该抬头看看天了。Cerebras 这次在 Hot Chips 2026 上扔出的东西,简直是在用大炮轰蚊子,而且是那种自带超音速引擎的大炮。
我也在想,如果这种架构真的能大规模商用,那现在那些靠堆卡、堆带宽来维持推理性能的方案,是不是很快就要变成过时的“手工作坊”了?现在的 AI 算力竞赛,表面看是模型参数的竞争,底层其实就是物理极限的肉搏。Cerebras 这种直接把整个晶圆当成一颗芯片玩的打法,确实有点不讲武德。
我刚才翻了一下他们的技术细节,最让我觉得荒谬(也最硬核)的一点是,他们完全跳出了那种“把芯片堆在一起”的传统逻辑。现在的 LLM 推理瓶颈基本都在内存带宽上,大家都在玩命堆 HBM,结果就像是在用吸管喝大海里的水。但 Cerebras 的逻辑是:既然吸管不够粗,那我干脆直接造个超级水坝。
他们的 Wafer-Scale Engine(晶圆级引擎)在处理 Frontier Model(前沿大模型)推理时,表现出来的延迟简直不像是在跑模型,更像是在跑一段本地的简单脚本。
- 核心逻辑: 他们不是在做传统的分布式计算,而是试图把整个模型直接“塞进”那块巨大的硅片里。
- 推理延迟: 这种架构下,Token 的生成速度快到你甚至没时间去思考下一句提示词该怎么写。
- 吞吐量优势: 相比于现在主流的 GPU 集群,这种单片级的集成方式省去了大量昂贵的节点间通信开销。
我也在想,如果这种架构真的能大规模商用,那现在那些靠堆卡、堆带宽来维持推理性能的方案,是不是很快就要变成过时的“手工作坊”了?现在的 AI 算力竞赛,表面看是模型参数的竞争,底层其实就是物理极限的肉搏。Cerebras 这种直接把整个晶圆当成一颗芯片玩的打法,确实有点不讲武德。
不过,这种方案的部署成本和配套的软件栈估计也是个巨大的坑,毕竟谁也不想为了跑个模型,还得专门去学一套完全不同的底层逻辑。
事件追踪 · 相关报道
Nvidia 的 Groq 3 LPX 宣称推理速度比 Cerebr
23小时前
IBM 的 Z 系列和 LinuxONE 居然要在 Hot Chip
2天前
Cerebras 那块盘子大的芯片真能打赢 H100 吗?
7天前
Cerebras CS-4 机柜上架实测
7天前
B200单卡性能逆袭:靠软件优化硬刚LPU与Cerebras
20天前
免费 AI 工具箱 · 全部完全免费