Cerebras 这次在 Hot Chips 2026 上展示的推理

PromptCube 专家 3小时前 563 浏览 6 点赞 约 1 分钟

说真的,如果大家还在盯着那几张 H100 的显存带宽死磕,那真的该抬头看看天了。Cerebras 这次在 Hot Chips 2026 上扔出的东西,简直是在用大炮轰蚊子,而且是那种自带超音速引擎的大炮。

我刚才翻了一下他们的技术细节,最让我觉得荒谬(也最硬核)的一点是,他们完全跳出了那种“把芯片堆在一起”的传统逻辑。现在的 LLM 推理瓶颈基本都在内存带宽上,大家都在玩命堆 HBM,结果就像是在用吸管喝大海里的水。但 Cerebras 的逻辑是:既然吸管不够粗,那我干脆直接造个超级水坝。

他们的 Wafer-Scale Engine(晶圆级引擎)在处理 Frontier Model(前沿大模型)推理时,表现出来的延迟简直不像是在跑模型,更像是在跑一段本地的简单脚本。

  • 核心逻辑: 他们不是在做传统的分布式计算,而是试图把整个模型直接“塞进”那块巨大的硅片里。
  • 推理延迟: 这种架构下,Token 的生成速度快到你甚至没时间去思考下一句提示词该怎么写。
  • 吞吐量优势: 相比于现在主流的 GPU 集群,这种单片级的集成方式省去了大量昂贵的节点间通信开销。

我也在想,如果这种架构真的能大规模商用,那现在那些靠堆卡、堆带宽来维持推理性能的方案,是不是很快就要变成过时的“手工作坊”了?现在的 AI 算力竞赛,表面看是模型参数的竞争,底层其实就是物理极限的肉搏。Cerebras 这种直接把整个晶圆当成一颗芯片玩的打法,确实有点不讲武德。

不过,这种方案的部署成本和配套的软件栈估计也是个巨大的坑,毕竟谁也不想为了跑个模型,还得专门去学一套完全不同的底层逻辑。

CerebrasHot Chips

全部回复 (3)

全栈小李 高级 2小时前
我之前跑长文本推理,频繁的换页延迟确实劝退,这种架构要是能解决数据搬运问题,效率得高多少。
0 回复
T
Tom 中级 2小时前
之前调优大模型时,显存带宽确实卡得我怀疑人生,这种架构确实是换了个思路。
0 回复
创业者阿杰 中级 2小时前
确实,带宽这块太难搞了。不过他们这种片上存储的架构,在大模型参数量再翻一倍后,片上SRAM够不够用啊?
0 回复

发表回复

支持 Markdown 格式