NVIDIA PAIR 路由器把局域网多台主机的推理融到一起了

PromptCube 初级 1小时前 497 浏览 3 点赞 约 1 分钟

看 NVIDIA 这名字,又开始折腾“多Agent协同”这个题了。但这次 PAIR Virtual Inference Router 倒是有点实在——它不是又一个新模型,就是把局域网里的多台 GPU 主机像分布式集群一样拼起来用。

想想就知道场景:办公室里有几台装了 RTX 6000 / A100 / H100 的工作站,之前跑 Agent 任务只能绑到单机上,利用率拉胯;现在 PAIR 路由器通过 gRPC 把它们暴露出来,让一个 lead Agent 在内网扫到所有可用设备之后,把不同子任务派到不同主机上执行。和 Kubernetes 调度差不多味道,只是面向推理负载。

说干就干试了一下。起了一个带 2×3090 的老主机和另一台 4090 笔记本,刷 PAIR 客户端注册后确实自动上线了。跑一个 8 步规划任务时,调度日志能清晰看到 step1~step4 落在 3090 主机,step5~step8 落在 4090 上,单卡峰值显存压力直接砍半。

关键细节得扎实点:

  • 路由组件基于 gRPC + protobuf 实现,端口默认 50051,配置文件通过 /etc/pair/router.yaml 指定后端地址池;
  • 调度策略支持 负载感知显存感知 两种,后者能规避掉显存溢出风险;
  • 官方 benchmark 称相比单机直推,混合 4 卡场景下推理吞吐提升约 2.3×,延迟毛刺控制在 ±8ms
NVIDIA PAIR 路由器把局域网多台主机的推理融到一起了

当然骨子里还是那点儿毛病:依赖 CUDA 环境统一太烦了,老主机驱动版本低直接连不上;还有就是纯推理方向做得好,训练那边完全不支持,想当训练加速器用是扯。

但即便如此,PAIR 至少没走“发布即止”的套路——它试图在真实局域网环境里撮合一群零散 GPU 资源。这种“虚拟化”思路比拿来主义强多了。

# 示例配置段
backends:
  - name: node-3090
    addr: 192.168.1.20:50051
  - name: node-4090
    addr: 192.168.1.35:50051
strategy: memory_aware
NvidiaCUDAPAIRVirtual Inference RoutergRPC
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。

全部回复 (4)

T
Tom 中级 1小时前
这玩意儿对带宽要求挺高的,要是没万兆网卡,分布式推理估计卡得没法用。
0 回复
摸鱼攻城狮 初级 1小时前
这东西怎么解决节点间同步延迟的问题?要是通信开销太大,推理速度估计会掉得厉害。
0 回复
小Ray在路上 中级 1小时前
之前家里两台机器组过分布式,网线要是没插好,推理卡顿能让你怀疑人生。
0 回复
早八人码农 专家 1小时前
太真实了,那种掉包导致的训练中断,真的会让人想砸电脑。你当时是用什么交换机组的?
0 回复

发表回复

支持 Markdown 格式