NVIDIA PAIR 路由器把局域网多台主机的推理融到一起了
看 NVIDIA 这名字,又开始折腾“多Agent协同”这个题了。但这次 PAIR Virtual Inference Router 倒是有点实在——它不是又一个新模型,就是把局域网里的多台 GPU 主机像分布式集群一样拼起来用。
当然骨子里还是那点儿毛病:依赖 CUDA 环境统一太烦了,老主机驱动版本低直接连不上;还有就是纯推理方向做得好,训练那边完全不支持,想当训练加速器用是扯。
想想就知道场景:办公室里有几台装了 RTX 6000 / A100 / H100 的工作站,之前跑 Agent 任务只能绑到单机上,利用率拉胯;现在 PAIR 路由器通过 gRPC 把它们暴露出来,让一个 lead Agent 在内网扫到所有可用设备之后,把不同子任务派到不同主机上执行。和 Kubernetes 调度差不多味道,只是面向推理负载。
说干就干试了一下。起了一个带 2×3090 的老主机和另一台 4090 笔记本,刷 PAIR 客户端注册后确实自动上线了。跑一个 8 步规划任务时,调度日志能清晰看到 step1~step4 落在 3090 主机,step5~step8 落在 4090 上,单卡峰值显存压力直接砍半。
关键细节得扎实点:
- 路由组件基于 gRPC + protobuf 实现,端口默认 50051,配置文件通过
/etc/pair/router.yaml指定后端地址池; - 调度策略支持 负载感知 和 显存感知 两种,后者能规避掉显存溢出风险;
- 官方 benchmark 称相比单机直推,混合 4 卡场景下推理吞吐提升约 2.3×,延迟毛刺控制在 ±8ms;
当然骨子里还是那点儿毛病:依赖 CUDA 环境统一太烦了,老主机驱动版本低直接连不上;还有就是纯推理方向做得好,训练那边完全不支持,想当训练加速器用是扯。
但即便如此,PAIR 至少没走“发布即止”的套路——它试图在真实局域网环境里撮合一群零散 GPU 资源。这种“虚拟化”思路比拿来主义强多了。
# 示例配置段
backends:
- name: node-3090
addr: 192.168.1.20:50051
- name: node-4090
addr: 192.168.1.35:50051
strategy: memory_aware 事件追踪 · 相关报道
写 CUDA 真的不是只要把 C++ 代码搬到 GPU 上那么简单
2小时前
有些公司对 AI 的态度其实挺矛盾的:老板一边喊着要数字化转型
5小时前
英伟达这次要是真把 Hugging Face 给吞了
10小时前
把家里闲置的旧显卡连起来搞个“私人AI数据中心”到底有多爽
13小时前
英伟达斥 129 亿美元收购 Hugging Face
18小时前
NBA 2K27 居然把 DLSS 5 给整上了
20小时前
免费 AI 工具箱 · 全部完全免费
更多可复用的提示词工作流收录在ChatGPT提示词优化指南,有不少直接可参考的案例。
