把 PCIe 6.0 硬盘当成 GPU 内存用,Kioxia CM10 这种设计逻辑到底怎么实现
最近关注到 Kioxia 推出的 CM10 企业级 SSD,这盘的定位非常诡异。它虽然挂着 PCIe 6.0 的名头,但其实并不是为了给传统的数据库或虚拟化服务器增加存储空间,而是精准地切入了 Nvidia CMX 平台的内存扩展场景。简单来说,这块盘的使命不是“存文件”,而是给 GPU 扩容,专门用来承载那些在 HBM(高带宽内存)里塞不下的 KV Cache。
在 AI 推理的实际部署中,长上下文和高并发推理会导致 KV Cache 迅速膨胀,动辄占用几十甚至上百 GB 的显存。如果全部堆在 HBM 里,成本高到离谱且容量上限太死。目前业界的主流思路是将这部分对实时性要求稍低、但体积巨大的数据挪到廉价存储上。但这里有个极大的痛点:KV Cache 对带宽和延迟极其敏感,如果使用 PCIe 5.0 的盘,传输延迟会导致 GPU 在等待数据时出现严重的空转,推理速度直线下降。
CM10 出现的时间点刚好卡在 PCIe 6.0 的带宽红利期。根据规格,PCIe 6.0 x4 的单向带宽达到了 12.8GB/s,相比 5.0 实现了翻倍。这个数字对于传统存储来说可能只是跑分提升,但对于 CMX 平台来说,它是让“硬盘模拟内存”在商业上可行性的关键阈值。Kioxia 此次同时推出了 E3.S 和 E1.S 两种形态,显然是为了适配不同密度的 GPU 机箱,确保在物理层面上能尽可能靠近 GPU 核心。
这里需要深挖一个细节:CM10 实际上是在扮演 CXL 内存扩展方案普及之前的“过渡桥梁”。真正的 CXL 内存池化方案在信号完整性和协议栈上极其复杂,而通过 PCIe 6.0 直连 SSD,可以在不改变太多架构的前提下,迅速给 GPU 增加一个巨大的、相对高速的缓存层。
不过,从工程实践来看,PCIe 6.0 的部署远没有想象中简单。在 64GT/s 的速率下,信号衰减非常严重,对 Retimer 芯片和线缆的依赖程度极高。我比较好奇的是,CM10 在实际部署时,是否仅限于 Nvidia 的特定参考设计?因为这种级别的带宽要求,如果不是在极其短的 PCB 走线环境下,很难保证信号的稳定性。目前看,CM10 更像是一件为 Nvidia 量身定制的“配件”,而非一块可以随意插在任何 PCIe 6.0 插槽里的通用存储盘。
对于大规模推理部署的工程师来说,CM10 的量产释放了一个核心信号:将 KV Cache 从显存卸载(Offloading)到 SSD 的方案已经从学术论文阶段走进了商用量产阶段。这意味着未来的推理架构将不再单纯依赖 HBM 的堆料,而是通过“HBM + 高速 PCIe 存储”的分级存储架构来解决上下文窗口过大的问题。
总结来看,CM10 并不是在卷 IOPS 或随机读写性能,它在卷的是如何通过翻倍的带宽,把 SSD 伪装成一个足够快、容量足够大的“伪内存”。这种存储形态的转变,可能会让很多习惯于传统存储分层的人感到不适,但它确实是目前解决 AI 推理显存焦虑最务实的路径。
batch一调大就爆显存太痛苦了,CM10 能把 KV 缓存挪走简直是救命药