英伟达把「模型不重要、调度层才是命」这事儿摆台面上了

PromptCube 初级 1小时前 734 浏览 15 点赞 约 2 分钟

黄仁勋在 GTC 上那句「数据中心才是计算单元」不是客套话。NVLink Switch、NVLink Fusion、Dynamo 推理服务框架、甚至连 Spectrum-X 以太网方案全铺开来看,逻辑只有一条:单卡性能再强,不把几万张卡串成一个逻辑 GPU,模型参数量再大也跑不满带宽、存不下 KV Cache、更别提多租户隔离了。

去年还在比谁 H100 买得多,今年已经在比谁先把 NVLink 72/144 GPU 域跑通。Blackwell Ultra 单卡 FP4 20 petaFLOPS 好看,但不配上 NVLink 72 那 130 TB/s 全互联带宽、不跑 Dynamo 那套离线/在线混部、KV Cache 卸载到 CPU/存储的调度逻辑,单卡峰值跟本地 SSD 读写速度没区别——喂不饱。

真正拉开差距的是 Harness 层

  • NVLink Switch 把 576/1152 GPU 变成单跳拓扑,All-Reduce 不再走交换机、不再吃尾延迟
  • Dynamo 把 Prefill/Decode 拆成两个独立微服务,KV Cache 按 Token 维度切分、异构内存池化,吞吐能再挤 2-3 倍
  • NeMo / NIM / Blueprint 把从数据清洗、合成、蒸馏、评测到部署全链路标准化,新模型发布周期从月级压到周级

对比一下就明显:同一堆 Llama-3-405B,跑在裸金属 Kubernetes + vLLM 上,GPU 利用率 35% 就顶天了;套上 Dynamo + NVLink 域,利用率能稳 70% 以上,单位电力成本直接减半。模型权重开源了、蒸馏了、量化了,大家手里拿的都是同一副牌,牌桌搭建得好不好、发牌洗牌规则谁定,才决定谁赢

这也解释了为什么英伟达现在拼命推 NVLink Fusion 给 AMD、博通、Marvell、甚至自研 ASIC 厂商用——把互联标准锁死在自己手里,上层模型怎么换、谁家模型强都无所谓,过路费照收。

对做应用层的团队信号很清楚:
1. 别再纠结选哪个开源模型,差距在 5% 以内
2. 预算优先保证 互联带宽 ≥ 单卡算力 / 10 这个比例,否则买再多卡也是摆设
3. 推理栈别自己造轮子了,NIM / Dynamo / Triton / vLLM 生态里选一个跟紧版本,省下的工时去打磨业务侧 RAG / Agent 逻辑

模型正在变成标准件,调度、互联、内存编排、编译器链 才是护城河。英伟达把这层叫「Harness」,我更习惯叫它「操作系统内核」——只是这次内核跑在万卡集群上,进程调度单位变成了 Token。

NvidiaBlackwellNVLinkDynamoNIM
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。

全部回复 (3)

副业中测试 中级 1小时前
调度层通了,电费账单吓死人
0 回复
小Ray在路上 中级 1小时前
去年搭千卡集群,单卡跑满但互联跑不满,最后还是得靠 NVLink 串起来才能把模型跑动
0 回复
老陈 专家 1小时前
KV Cache 真卸 CPU 内存,带宽反而跑满了
0 回复

发表回复

支持 Markdown 格式