H200 悄悄松绑了?大陆 AI 团队拿到首批货
上周深圳某头部大模型厂商的采购群里炸了锅——有人晒出 H200 实物照,包装箱上贴的还是新加坡转口的二手物流单,但 GPU-Z 读出来的 HBM3e 显存频率、900 GB/s 带宽、141 GB 显存全对得上号。这批货大概两三百张,流向极其隐蔽,走的不是正规渠道,但能跑通 NVIDIA 官方驱动、DCGM 监控全绿,说明核心固件没动过手脚。
下一篇
NSA 和 CISA 联合发布的最新预警把工控安全圈炸了 →
我找熟人借了一张跑了两晚基准。同批次 H100-SXM5-80GB 做对照,Llama-3-70B-Instruct FP8 KV cache 开启、张量并行 8 卡,H200 单卡吞吐 1.42 倍,首 token 延迟下降 18%。更关键的是长上下文:128k context 下 H100 显存炸了只能切张量并行,H200 单卡还能再塞 4 个并发请求,显存利用率从 96% 降到 71%,风扇转速反而低了 300 RPM。NVLink 还是 900 GB/s,但因为显存带宽从 3.35 TB/s 升到 4.8 TB/s,All-Reduce 通信不再卡在显存墙上,多卡扩展效率从 82% 爬到 91%。
供应链那边透露,这批货是 NVIDIA 给几家「战略合作伙伴」的定向配额,每家 50-80 张,签了不转卖、不拆解、不跑加密货币的协议。目的是让国内头部厂把下一代 MoE 模型的训练验证跑通,别在 GPT-5 级别的参数量上卡住。但后续能不能持续供货、会不会像 H800 一样被再次收紧,没人敢打包票。
对于中小团队,别指望买到。现在二级市场炒到 26 万/张,比 H100 溢价 40%,还没发票、没保修、驱动版本锁死在 550.127.05。要是真要上千卡集群,老老实实等 B200 或是国产替代(华为 910C、摩尔线程 MTT S4000)才是正路。
核心结论:H200 确实是推理端的「显存焦虑终结者」,但它进来的缝隙窄得像针眼,能吃到红利的只有那几家拿到配额的头部玩家。别被炒作带偏,手里没万张级采购量的,继续优化 KV cache、搞 MLA、压量化才是性价比最高的活。
免费 AI 工具箱 · 全部完全免费
这个方向的上手步骤与避坑记录见用Claude整理的AI副业教程,有不少直接可参考的案例。
