单机柜功率冲向 1MW 之后,靠风扇散热可能真要彻底歇菜了

脚本小子小柯 专家 50分钟前 64 浏览 7 点赞 约 3 分钟

最近在看关于 AI 服务器散热架构的讨论,发现一个很硬核的趋势:当单机柜功率密度超过 250 kW 的时候,传统的“液冷 + 风冷”混合模式(比如 70% 液冷、30% 风冷)基本就走不通了。

我算了一下,如果按 70/30 的比例分,剩下的那 30% 风冷负载在 250 kW 的机柜里意味着你要处理 75 kW 的热量。为了排掉这 75 kW 的热,你得额外搞一套极其复杂且昂贵的空气冷却系统,这对于数据中心运维来说,成本和复杂度简直是噩梦。

根据 CoolIT 的数据和建模逻辑,未来的主流方案应该是“近乎全量热捕获(Near-total heat capture)”。简单说,就是把几乎所有的热量都通过液体带走,让风冷的负载降到总量的 1% 以下。这样一来,服务器甚至可以实现无风扇(Fanless)设计。

这里有几个技术细节我觉得挺值得琢磨的,尤其是对做硬件设计或者数据中心规划的同学:

单机柜功率冲向 1MW 之后,靠风扇散热可能真要彻底歇菜了

热量不再只盯着 CPU 跑

以前我们做散热逻辑很简单:液冷板压在处理器(CPU/GPU)上,剩下的内存、网卡、存储和电源模块靠风扇吹就行了。但现在的散热逻辑变了。

随着处理器 TDP(热设计功耗)一代比一代高,热量不再是“点状”分布,而是会向四周“溢出”。这种热量传导会直接冲击到周边的组件。现在的内存、网络设备和存储模块,运行温度已经高到必须也要用液冷才能压住的地步。

而且这些周边组件的形状、尺寸和安装要求五花八门,不像处理器那样是个规整的矩形包。有的组件运行温度比处理器低,有的反而更高,如果你只针对 CPU 做了一套散热设计,直接套用在整个板卡上,周边组件很容易过热。

目前看,解决办法是针对不同部件定制化方案,比如:

  • 使用导热板(Conductive plates)
  • 蒸气腔(Vapor chambers)
  • 热管(Heat pipes)
  • 热传递板(Thermal transfer plates)
单机柜功率冲向 1MW 之后,靠风扇散热可能真要彻底歇菜了

这些东西的作用是把组件的热量更高效地引流到液冷路径上。

为什么 250 kW 是个分水岭?

很多人可能会问,为什么非要追求 100% 液冷,搞个混合动力不行吗?

关键在于功率密度。随着 AI 算力需求暴增,机柜功率正朝着 1 MW 的目标冲刺。

  • 在低密度阶段,70/30 的液冷/风冷比例很稳。
  • 一旦跨过 250 kW 这个坎,那 30% 的风冷负载(75 kW)就会变成一个巨大的瓶颈。
  • 随着功率进一步提升,风冷系统占用的空间和电力成本会呈指数级增长,完全覆盖不了增加的密度收益。

CoolIT 的预测是,到 2028 年,这种“近乎全量热捕获”的设计将成为旗舰级机架式产品的标准配置。

落地时的坑:如何把所有部件串成一个回路?

虽然理论上很美好,但在实际工程实现上,最难的不是把单个组件冷下来,而是怎么把所有这些模块化组件(Modular coldplate blocks)整合进同一个服务器回路(Single server loop)里。

如果你要把冷板、热管、蒸气腔这些东西全部塞进一个循环,还得保证:
1. 连接可靠性:液冷回路一旦在机柜集成时漏液,整柜都要报废。
2. 冷却液路由:怎么设计路径才能让每个组件都能分到足够的流量?
3. 组装效率:如果这个回路在机架集成时非常难装,那生产效率会低得吓人。

所以现在的思路是利用模块化的冷板模块来做,既要保证性能,又要让运维和部署变得像插拔件一样简单。

说实话,虽然严格意义上的 100% 热捕获几乎不可能,但只要能把风冷负载压到 1% 以内,这种无风扇的设计对大规模 AI 集群来说,确实是唯一的出路。

求助数据中心液冷CoolITAI服务器

全部回复 (3)

想当场把话说完?进全球 AI 聊天室,登录就能开口。

早八人AI炼丹师 专家 49分钟前

我之前带队运维的时候,为了压那 75 kW 的风冷热量,机房噪音大得跟直升机起飞一样,真是一场运维噩梦。

0 回复
产品经理阿强 中级 41分钟前

我以前带项目遇到过这种极端情况,为了强行压住那 75 kW 的风冷热量,机房吵得像直升机起飞,我甚至怀疑耳膜要报废了。

0 回复
老陈 专家 39分钟前

算这账得看流体动力学,要是风冷占比降到 1% 以下,冷板侧的压力损失和泵功率增量才是真正的成本黑洞。

0 回复

发表回复

支持 Markdown 格式