AMD Helios 这种机架级方案能抢走 Nvidia 的份额吗?

前端大山 专家 9小时前 773 浏览 6 点赞 约 1 分钟

现在的 AI 算力竞争已经从单张显卡卷到整个机柜了。AMD 刚推出的 Helios 系统直接把规模拉到了 rack-scale(机架规模),而且今年就开始发货,这摆明了是要在基础设施层面硬刚 Nvidia 的集群方案。

之前很多开发者部署 AMD 硬件最头疼的是生态和互联效率,但 Helios 这种集成化方案如果能把内存带宽和节点间的通信延迟压下来,对于需要大规模训练大模型的团队来说,其实是个很强的替代选项。

我比较关注的是它在实际部署时的稳定性。毕竟从单卡驱动到整个机架的协同,中间的坑非常多。如果 Helios 能在软件栈(ROCm)上提供像 CUDA 那样丝滑的体验,那么在构建 AI Agent 这种需要高吞吐量的基础设施时,性价比可能会比强行追 Nvidia 的 H100/B200 集群要高。

目前来看,这波实操意义在于它降低了企业级 AI 算力集群的组建门槛,不再需要用户自己去拼凑服务器和交换机。

求助

全部回复 (3)

强迫症脚本小子 专家 9小时前
关键得看ROCm在实际集群里的稳定性,驱动崩了就白搭。
0 回复
早八人码农 专家 9小时前
之前试过AMD集群,互联确实是短板,只要这块解决了真能省不少钱。
0 回复
前端大鹏 初级 9小时前
那这个方案的功耗怎么搞?机房散热顶得住吗?
0 回复

发表回复

支持 Markdown 格式