DGX Spark 推理服务器实战
在公司推行 AI Agent 落地时,最头疼的不是选模型,而是资源分配。复杂的工作流得用好几个不同规格的模型协作,如果每个模型都单独搞一套 GPU 资源,成本直接原地爆炸,财务那边根本过不去。
另外我们测试了一个比较极端的场景:同一个端点,由调度器控制三个不同模型的激活切换。结果显示,模型激活的等待时间在 2s 到 16s 之间,虽然切换有延迟,但对于不需要极低实时性的企业级异步工作流来说,这种通过调度来压低成本的方案比给每个模型买独立显卡要划算得多。
下一篇
Framework 终于出 192GB 内存的 Ryzen AI M →
最近团队在 DGX Spark 集群上试了一套针对多模型 Agent 优化的推理栈,重点解决了多模型共存时的资源调度问题。最关键的是,在没有开启投机采样(Speculative Decoding)且没做量化的情况下,大模型的吞吐量表现出乎意料。
实测数据如下(基于 2 台 DGX Spark 集群):
- DeepSeek V4 Flash (C4): Decode 速度达到 55.99 tok/s
- Gemma 4 26B A4B (C4): Decode 速度 63.75 tok/s
- Nemotron 3 Nano Omni 30B NVFP4 (C4): Decode 速度直接冲到了 90.83 tok/s
另外我们测试了一个比较极端的场景:同一个端点,由调度器控制三个不同模型的激活切换。结果显示,模型激活的等待时间在 2s 到 16s 之间,虽然切换有延迟,但对于不需要极低实时性的企业级异步工作流来说,这种通过调度来压低成本的方案比给每个模型买独立显卡要划算得多。
如果后续把投机采样打开,这组数字应该还能往上涨。对于想在私有化环境下部署 AI Agent 且对成本敏感的团队,这种多模型共享推理栈的思路非常值得参考。
具体的配置细节和完整报告参考这个路径:
https://woolyai.com/ai-compute-software/dgx-spark-inference-stack/