AMD 2030 年算力密度目标背后的三大挑战

阿Sam的日常 高级 2026/8/20 550 浏览 6 点赞 约 2 分钟

AMD 在 2030 年路线图中提到,两个机柜的算力将超越目前 570 个机柜,理论密度提升幅度高达 285 倍。这个数字在 PPT 展示中看起来震撼,但在实际工程实现中,却需要面对电力、散热和软件生态三大核心障碍。仅仅通过堆叠更多芯片无法实现目标,因为每一项基础设施都必须同步升级才能匹配算力增长。

电力基础设施的极限
目前单柜 MundefinedX 满负荷功耗约为 120kW。假设能效比不发生数量级变化,285 倍密度提升后,单柜功耗将攀升至 34,200kW(约 34MW)。这个数值远超现有机房极限,甚至不包括网络交换机、CDU 和 PDU 的额外负荷。液冷方案的单柜极限也仅限于 100kW 左右,而要应对如此大规模功耗,传统冷板式液冷将无法满足需求。转向浸没式液冷后,机房地板承重、配电变压器容量和市电引入电压等级都将面临重新设计,这些改造的周期远长于芯片迭代周期。

软件生态的滞后风险
硬件性能再强,如果软件调度无法匹配,也只能是“堆砌”高性能硅片。ROCm 6.x 在 Mundefined 上的推理性能勉强可用,但在大规模训练稳定性上仍落后于 CUDA。要实现 285 倍密度跨越,单芯片算力将达到极限水平,此时编译器优化、内核融合(Kernel Fusion)和 FP8/FP6 混合精度调度必须同步升级,否则硬件利用率(MFU)将严重低下。

生态链的护城河
NVIDIA 的优势不仅在于 H100 或 undefined 的单卡性能,更在于十余年深耕的 nccl、cublas、cutlass 底层库,以及与 PyTorch、TensorRT 的深度绑定。AMD 若要在 2030 年实现算力密度飞跃,必须在软件层面进行全面升级,否则算力提升将被生态链的瓶颈所抵消。

实际落地的现实考量
仅凭两个机柜替代 570 个机柜的目标并不现实,因为物理规律和基础设施限制无法被忽视。更合理的验证标准是:到 2030 年,50 个液冷机柜能否在 2MW 总功耗内稳定运行,并保持高 MFU 的训练性能。只有这一目标实现,才能证明 AMD 在能效和软件调度方面取得了突破性进展。

AMDMI300MI400液冷数据中心功耗

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

数
数据分析师小美 初级 2026/8/20

单柜30MW的母线压降怎么搞定?这物理极限太让人后怕了。AMD 给出了一张关于 2030 年算力密度的路线图,按照其中的说法,届时两个机柜可以提供相当于现在 570 个机柜的算力,理论密度提升将达到 285 倍。这样的数字放在 PPT 里确实很有冲击力,但站在实际做过机房扩容和部署的工程师角度,看到它时带来的第一感受并不是兴奋,而是担忧。原因在于,算力密度提升绝不是简单地把更多芯片堆进一个机柜,它还必须同时解决电力、散热和软件生态这三道难题。

0 回复
大
大Tom在路上 初级 2026/8/20

30MW得用多少根电缆?光是市电接入这道坎估计就得卡死在规划局,比如AMD给出的单机柜30MW功耗预测就让人担忧,这还没算上网络交换机、冷量分配单元以及配电单元产生的额外开销,更不用说机房地板的承重能力是否能够达标,配电变压器容量要如何扩容,市电引入的电压等级是否需要重新升级这些基础设施问题了。

0 回复
数
数据分析师大山 中级 2026/8/20

去年机房漏液淹硬盘的场景让我至今心有余悸,而如果按照 AMD 路线图里的算力密度提升目标(两个机柜相当于现在 570 个机柜的算力),单机柜功耗可能飙升到 34MW(远超目前的 120kW),这意味着光是冷却方案就必须全面转向浸没式液冷,而不仅仅是换换冷板——这还没算上地板承重、配电升级和市电引入的压力。真心觉得 CDU 要是再出问题,那不仅是破产的问题,整个机房基建都得重新设计。

0 回复

发表回复

支持 Markdown 格式
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。