英伟达把「模型不重要、调度层才是命」这事儿摆台面上了
黄仁勋在 GTC 上那句「数据中心才是计算单元」不是客套话。NVLink Switch、NVLink Fusion、Dynamo 推理服务框架、甚至连 Spectrum-X 以太网方案全铺开来看,逻辑只有一条:单卡性能再强,不把几万张卡串成一个逻辑 GPU,模型参数量再大也跑不满带宽、存不下 KV Cache、更别提多租户隔离了。
对比一下就明显:同一堆 Llama-3-405B,跑在裸金属 Kubernetes + vLLM 上,GPU 利用率 35% 就顶天了;套上 Dynamo + NVLink 域,利用率能稳 70% 以上,单位电力成本直接减半。模型权重开源了、蒸馏了、量化了,大家手里拿的都是同一副牌,牌桌搭建得好不好、发牌洗牌规则谁定,才决定谁赢。
去年还在比谁 H100 买得多,今年已经在比谁先把 NVLink 72/144 GPU 域跑通。Blackwell Ultra 单卡 FP4 20 petaFLOPS 好看,但不配上 NVLink 72 那 130 TB/s 全互联带宽、不跑 Dynamo 那套离线/在线混部、KV Cache 卸载到 CPU/存储的调度逻辑,单卡峰值跟本地 SSD 读写速度没区别——喂不饱。
真正拉开差距的是 Harness 层:
- NVLink Switch 把 576/1152 GPU 变成单跳拓扑,All-Reduce 不再走交换机、不再吃尾延迟
- Dynamo 把 Prefill/Decode 拆成两个独立微服务,KV Cache 按 Token 维度切分、异构内存池化,吞吐能再挤 2-3 倍
- NeMo / NIM / Blueprint 把从数据清洗、合成、蒸馏、评测到部署全链路标准化,新模型发布周期从月级压到周级
对比一下就明显:同一堆 Llama-3-405B,跑在裸金属 Kubernetes + vLLM 上,GPU 利用率 35% 就顶天了;套上 Dynamo + NVLink 域,利用率能稳 70% 以上,单位电力成本直接减半。模型权重开源了、蒸馏了、量化了,大家手里拿的都是同一副牌,牌桌搭建得好不好、发牌洗牌规则谁定,才决定谁赢。
这也解释了为什么英伟达现在拼命推 NVLink Fusion 给 AMD、博通、Marvell、甚至自研 ASIC 厂商用——把互联标准锁死在自己手里,上层模型怎么换、谁家模型强都无所谓,过路费照收。
对做应用层的团队信号很清楚:
1. 别再纠结选哪个开源模型,差距在 5% 以内
2. 预算优先保证 互联带宽 ≥ 单卡算力 / 10 这个比例,否则买再多卡也是摆设
3. 推理栈别自己造轮子了,NIM / Dynamo / Triton / vLLM 生态里选一个跟紧版本,省下的工时去打磨业务侧 RAG / Agent 逻辑
模型正在变成标准件,调度、互联、内存编排、编译器链 才是护城河。英伟达把这层叫「Harness」,我更习惯叫它「操作系统内核」——只是这次内核跑在万卡集群上,进程调度单位变成了 Token。
事件追踪 · 相关报道
英伟达 AVO 直接把 ARC-AGI-3 刷满分了
9小时前
英伟达把 GPU 变成「理财产品」了,黑石、阿波罗、高盛排队抢着买单
1天前
Cerebras 那块盘子大的芯片真能打赢 H100 吗?
2天前
英伟达这波财务操作我真看不懂,回购规模直接砸下500亿美金
2天前
用 PantheonGPU 把显卡跑一遍压力测试才发现温度正常不代表
3天前
这家估值 210 亿美元的 Kids in Chips 到底在抢英伟
3天前
免费 AI 工具箱 · 全部完全免费
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。