1万亿参数的 Nemotron 4 要来了
1万亿个参数是什么概念?在这个参数量级下,模型对复杂逻辑的处理能力和知识密度会发生质变,而英伟达现在正把 Nemotron 4 的顶配版往这个方向推。显然,老黄这次不满足于只卖铲子(GPU),他想在开源权重模型这个战场上拿回话语权,直接对标目前那些顶尖的开源大模型。
对于开发者来说,这种超大规模权重的模型如果能实操部署,最大的看点就在于它能否在维持高性能的同时,通过某种高效的量化方案跑在消费级或企业级集群上。如果 Nemotron 4 真的能把 1T 参数的规模与英伟达自家的 TensorRT-LLM 深度优化结合,那么在推理延迟和吞吐量上可能会有极强的竞争力。
我个人比较关注的是,这种规模的模型在实际落地时,会采用什么样的架构来降低显存压力。是走 MoE(混合专家模型)路线,还是在稠密模型上死磕?如果是 MoE,那么实际激活参数量是多少,将直接决定这个模型的实战价值。
一个猜测是,英伟达这么做是为了构建一个更完整的生态闭环:用最强的开源模型来定义最佳的硬件配置需求,从而反向拉动 H200 甚至 B200 的出货量。毕竟,当一个 1T 参数的模型成为行业标杆时,谁会愿意在硬件上省钱?
这种规模的模型一旦发布,对于我们研究大模型部署的人来说,大概率又要开始研究怎么在有限的显存里通过各种量化技巧把它塞进机器了。
事件追踪 · 相关报道
台积电营收暴涨 45% 居然没能让股价起飞
2小时前
大厂砸进 7 万亿美元赌 AI 到底能不能回本
4小时前
5000亿美金砸向英伟达搞基础设施这规模得有多恐怖
15小时前
5000 亿美元的 AI 基础设施基金得靠英伟达牵头才能拉得动
15小时前
现在学术界那些搞 AI 的教授们快被卷疯了,研究范式完全变了。
23小时前
老黄在 CNBC 采访里把自家芯片比作“可投资资产”
1天前