NVLink 与 Dynamo 构筑算力壁垒:调度层才是关键
黄仁勋在 GTC 上提出“数据中心才是计算单元”,并非虚言。NVLink Switch、NVLink Fusion、Dynamo 推理服务框架以及 Spectrum‑X 以太网方案均已落地,底层逻辑清晰可见:单卡性能再强,也难以把数万张卡整合为逻辑 GPU;模型参数再大,仍受限于带宽、KV Cache 容量,且缺乏多租户隔离。
去年行业仍在争夺谁拥有更多 H100 卡,年内焦点已转向谁先实现 NVLink 72/144 GPU 域的全链路跑通。Blackwell Ultra 单卡 FP4 20 petaFLOPS 亮眼,但若未配备 NVLink 72 那 130 TB/s 的全互联带宽、未使用 Dynamo 的离线/在线混合调度、未将 KV Cache 卸载至 CPU/存储,单卡峰值表现与本地 SSD 读写速度相当,难以发挥潜力。
Harness 层如何决定算力效率
真正拉开玩家差距的,是底层 Harness 层:
- NVLink Switch 将 576/1152 GPU 整合为单跳拓扑,All‑Reduce 不再绕交换机,尾延迟得以削减。
- Dynamo 将 Prefill 与 Decode 拆分为独立微服务,KV Cache 按 Token 维度切分、实现异构内存池化,吞吐提升 2‑3 倍。
- NeMo、NIM 与 Blueprint 将数据清洗、合成、蒸馏、评测到部署全链路标准化,新模型发布周期从月级压缩至周级。
同批 Llama‑3‑405B 在裸金属 Kubernetes 加 vLLM 上运行时,GPU 利用率仅 35% 即触顶;套用 Dynamo 与 NVLink 域后,利用率稳保持在 70% 以上,单位电力成本直接减半。模型权重虽已开源、蒸馏、量化,但所有人手中的牌相同,牌桌的搭建与洗牌规则决定了最终的胜负。
NVLink 标准化构建的壁垒
英伟达全力推广 NVLink Fusion 给 AMD、博通、Marvell 以及自研 ASIC 厂商,意在将互联标准锁定在自己手中。上层模型的迭代与优劣不再是核心,过路费仍可持续收取。
对应用层团队的提示如下:
- 不必再纠结选择哪款开源模型,模型之间的差距已在 5% 以内。
- 预算应优先保证互联带宽不低于单卡算力的十分之一,否则即使卡数再多也难以发挥效能。
- 推理栈不必自行构建,选择 NIM、Dynamo、Triton 或 vLLM 生态中的一个成熟版本,可将省下的工时用于业务侧 RAG 与 Agent 逻辑的打磨。
互联与编排成为 AI 时代的核心
模型正逐渐转为可替换的标准件,调度、互联、内存编排与编译器链才是真正的护城河。英伟达将此层称为 “Harness”,相当于“操作系统内核”,只是在万卡集群上运行时,进程调度的单位变为 Token。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
去年死磕千卡集群才发现,NVLink 没搞定的话单卡跑满也白搭,调度才是关键。黄仁勋在GTC抛出的「数据中心才是计算单元」绝非客套。NVLink Switch、NVLink Fusion、Dynamo推理服务框架、乃至Spectrum-X以太网方案全数落地,底层逻辑再清晰不过:单卡性能再强,没法把几万张卡整合成逻辑GPU,模型参数量再大也跑不满带宽、存不下KV Cache,更别提多租户隔离了。 去年行业还在卷谁买的H100多,今年已经转到谁先跑通NVLink 72/144 GPU域。Blackwell Ultra单卡FP4 20 petaFLOPS的数值确实亮眼,但不搭NVLink 72那130 TB/s全互联带宽、不跑Dynamo这套离线/在线混部、KV Cache卸载到CPU/存储的调度逻辑,单卡峰值表现和本地SSD读写速度没差——根本喂不饱。 ## 底层Harness层如何决定算力效率? 真正拉开玩家间差距的,是底层Harness层: - NVLink Switch把576/1152 GPU整合成单跳拓扑,All-Reduce不再绕交换机、不再吃尾延迟 - Dynamo把Prefill/Decode拆成两个独立微服务,KV Cache按Token维度切分、异构内存池化,吞吐能再榨出2-3倍 - NeMo / NIM / Blueprint把从数据清洗、合成、蒸馏、评测到部署全链路标准化,新模型发布周期从月级压缩到周级 对比结果一目了然:同一批Llama-3-405B,跑在裸金属Kubernetes加vLLM上,GPU利用率35%就到天花板了;套上Dynamo加NVLink域,利用率能稳在70%以上,单位电力成本直接减半。模型权重开源了、蒸馏了、量化了,所有人手里的牌都是一样的,牌桌搭得好不好、发牌洗牌的规则由谁定,才最终决定谁赢。 ## 英伟达通过互联标准构建怎样的壁垒? 这也解释了英伟达现在全力推NVLink Fusion给AMD、博通、Marvell、甚至自研ASIC厂商用的原因——把互联标准攥死在自己手里,上层模型怎么迭代、哪家模型更强都无所谓,过路费照收。 给做应用层的团队的信号非常明确: 1. 别再纠结选哪个开源模型,彼此间的差距在5%以内 2. 预算优先保障互联带宽≥单卡算力/10的比例,否则买再多卡也只是摆设 3. 推理栈别自己造轮子,在NIM / Dynamo / Triton / vLLM生态里选一个跟进版本,省下的工时去打磨业务侧RAG / Agent逻辑 ## 互联与编排是否成为AI时代的内核? 模型正在变成可替换的标准件,调度、互联、内存编排、编译器链才是真正
把KV Cache直接卸载到CPU内存,让GPU能专注于计算而不被带宽拖后腿,这波操作确实太野了——尤其是结合Dynamo框架按Token维度切分缓存、异构内存池化的设计,直接把吞吐提升了2-3倍。更关键的是,这背后的逻辑早就被黄仁勋在GTC上抛出过:“数据中心才是计算单元”,而NVLink Switch、NVLink Fusion和Dynamo的组合,正是把几万张卡整合成逻辑GPU的关键。单卡算力再强,不搭配这种全互联带宽和KV Cache卸载机制,就算FP4 20 petaFLOPS也只能当作本地SSD读写速度——根本喂不饱。
调度层跑通了确实爽,但看到电费单那一刻,我觉得我还是在烧钱买寂寞。其实单卡堆再多也没用,还是得把预算优先保障互联带宽≥单卡算力/10的比例,不然硬件利用率上不去,单位电力成本根本压不下来。