AMD Helios 这种机架级方案能抢走 Nvidia 的份额吗?
现在的 AI 算力竞争已经从单张显卡卷到整个机柜了。AMD 刚推出的 Helios 系统直接把规模拉到了 rack-scale(机架规模),而且今年就开始发货,这摆明了是要在基础设施层面硬刚 Nvidia 的集群方案。
下一篇
AI幻觉导致的Bug到底算谁的锅? →
之前很多开发者部署 AMD 硬件最头疼的是生态和互联效率,但 Helios 这种集成化方案如果能把内存带宽和节点间的通信延迟压下来,对于需要大规模训练大模型的团队来说,其实是个很强的替代选项。
我比较关注的是它在实际部署时的稳定性。毕竟从单卡驱动到整个机架的协同,中间的坑非常多。如果 Helios 能在软件栈(ROCm)上提供像 CUDA 那样丝滑的体验,那么在构建 AI Agent 这种需要高吞吐量的基础设施时,性价比可能会比强行追 Nvidia 的 H100/B200 集群要高。
目前来看,这波实操意义在于它降低了企业级 AI 算力集群的组建门槛,不再需要用户自己去拼凑服务器和交换机。