d-Matrix 把 Raptor XPU 接入 NVLink Fusion
如果一个芯片厂商想把自己的 AI 芯片推向大规模部署,最头疼的其实不是算力,而是怎么把芯片塞进数据中心的机架、怎么散热、怎么解决网络互联。d-Matrix 这次宣布用 NVLink Fusion 把他们的 Raptor XPU 接入英伟达的 MGX 架构,简单说就是不再自己死磕机架标准,而是直接“寄生”在英伟达已经验证过的生态里,这样能极快地缩短从芯片研发到实际部署的周期。
为什么第三方 XPU 需要接入 NVLink Fusion?
很多自研芯片公司在产品原型阶段表现很强,但一旦进入“AI 工厂”规模的部署,就会撞墙。因为一个标准的 AI 机架涉及电源、液冷、高速互联接口和复杂的供应链,如果自研一套,不仅成本极高,而且客户(数据中心)不敢买,因为没有经过大规模验证。
NVLink Fusion 充当了一个“标准化接口”。d-Matrix 通过这个技术,让 Raptor XPU 能直接兼容 NVIDIA MGX 机架架构。这意味着数据中心不需要为每种处理器单独设计一套机架,一套标准机架就能同时跑 GPU、CPU 和 XPU。对于开发者和运维来说,这种统一性降低了部署风险,因为液冷和电力分配都是英伟达跑通的成熟方案。
具体的技术集成链路是怎么跑的?
从公布的细节来看,d-Matrix 的集成方案不是简单的物理兼容,而是深度的网络互联。
- Scale-up(向上扩展): Raptor XPU 将通过 NVLink 构建一个高带宽、低延迟的互联域。这意味着多颗 XPU 之间的数据交换速度能维持在极高水平,这对超低延迟推理至关重要。
- Scale-out(向外扩展): 他们计划集成 Spectrum-X 以太网方案,解决跨机架的通信问题。
- 硬件生态链: 除了 XPU 本身,d-Matrix 还会搭配使用 NVIDIA Vera CPU、ConnectX-9 SuperNIC 以及 BlueField-4 DPU。
这种模式对行业有什么启发?
我认为这标志着英伟达正在从一个“卖芯片的公司”彻底转变为“定义 AI 基础设施标准的平台”。
以前很多芯片公司想做英伟达的竞争对手,试图在全栈(芯片+网络+机架)上全面超越。但现在 d-Matrix 证明了,与其在基础设施上浪费时间,不如选择一个开放的生态。对于想要进入 AI 硬件市场的创业公司,这种“半自定义”路径(Custom Silicon + Standard Infrastructure)可能是生存率最高的方式。
当然,这也意味着第三方芯片公司在底层协议上会对英伟达产生更强的依赖。但考虑到现在推理需求暴增,客户更在乎的是能不能快速部署、能不能稳定运行,而不是这个机架是谁定义的。
部署时的潜在成本与风险
虽然 NVLink Fusion 降低了技术风险,但实际落地时仍有几个点需要注意:
- 成本区间: 采用 MGX 架构意味着必须购买英伟达的配套网络设备(如 Spectrum-X 交换机)和 DPU。虽然单颗 XPU 成本可能低,但整机部署的资本支出(CAPEX)依然会被英伟达的生态绑定。
- 兼容性调试: 虽然有标准接口,但不同架构的 XPU 在驱动层与 NVLink 协议对接时,往往需要经过数月的调优才能达到理论带宽,这部分时间成本是不可忽略的。
- 性能波动: 在混合部署(GPU + XPU)的环境下,如何保证任务调度不产生瓶颈,取决于软件层的协同,而非单纯的硬件互联。

就事论事,光蹭生态有用吗?要是带宽对不上,跑 800G 的时候会不会直接卡死在接口上?