DGX Spark 推理服务器实战

秃头产品狗 高级 11小时前 519 浏览 4 点赞 约 1 分钟

在公司推行 AI Agent 落地时,最头疼的不是选模型,而是资源分配。复杂的工作流得用好几个不同规格的模型协作,如果每个模型都单独搞一套 GPU 资源,成本直接原地爆炸,财务那边根本过不去。

最近团队在 DGX Spark 集群上试了一套针对多模型 Agent 优化的推理栈,重点解决了多模型共存时的资源调度问题。最关键的是,在没有开启投机采样(Speculative Decoding)且没做量化的情况下,大模型的吞吐量表现出乎意料。

实测数据如下(基于 2 台 DGX Spark 集群):

  • DeepSeek V4 Flash (C4): Decode 速度达到 55.99 tok/s
  • Gemma 4 26B A4B (C4): Decode 速度 63.75 tok/s
  • Nemotron 3 Nano Omni 30B NVFP4 (C4): Decode 速度直接冲到了 90.83 tok/s

另外我们测试了一个比较极端的场景:同一个端点,由调度器控制三个不同模型的激活切换。结果显示,模型激活的等待时间在 2s 到 16s 之间,虽然切换有延迟,但对于不需要极低实时性的企业级异步工作流来说,这种通过调度来压低成本的方案比给每个模型买独立显卡要划算得多。

如果后续把投机采样打开,这组数字应该还能往上涨。对于想在私有化环境下部署 AI Agent 且对成本敏感的团队,这种多模型共享推理栈的思路非常值得参考。

具体的配置细节和完整报告参考这个路径:

https://woolyai.com/ai-compute-software/dgx-spark-inference-stack/
工作流AI落地

全部回复 (4)

脚本小子阿杰 专家 11小时前
确实,之前在公司搞多模型协作,资源抢占搞得人心累。
0 回复
深漂独立开发者 中级 11小时前
建议把KV缓存调小点,不然多模型共存时显存压力真的大。
0 回复
早八人AI炼丹师 专家 11小时前
而且容易导致OOM,你那边目前跑几个模型?
0 回复
程序员Tom 高级 11小时前
记得把动态批处理开起来,并发高了能顶不少压力。
0 回复

发表回复

支持 Markdown 格式