NVIDIA Personal AI Router (PAIR) 是一款开源的本地AI推理路由器
NVIDIA Personal AI Router (PAIR) 详细部署教程
NVIDIA Personal AI Router (PAIR) 是一款开源的本地AI推理路由器,能将家庭网络中的多台兼容设备(如RTX PC、DGX Spark、Mac)组成一个AI集群,自动将推理请求分发到负载较低的节点上,从而加速多智能体等并行工作负载。本教程将介绍其部署与使用方法。
1. 系统概述与准备工作
PAIR的核心价值在于将局域网内闲置的算力利用起来,尤其适合多智能体(Multi-Agent)工作流中大量并发的推理请求。它不会将多个GPU合并为一个虚拟GPU,也不会拆分单个推理请求,而是将每个独立的请求路由到最合适的节点上执行。
在开始部署前,请确保你的硬件满足要求。这是最关键的一步,PAIR对硬件有明确的型号门槛,并非任意一台电脑都可以参与。
| 硬件要求 | 支持型号 |
|---|---|
| GPU(Windows/Linux) | NVIDIA GeForce RTX 20系列及更新型号、RTX PRO工作站GPU(图灵架构起)、NVIDIA DGX Spark/GB10 |
| 芯片(macOS) | Apple M4芯片及更新型号 |
| 内存 | 8 GB 或以上 |
| 磁盘空间 | 推荐 20 GB 或以上(用于存放模型和日志) |
| 操作系统 | Windows 11、macOS Tahoe、Ubuntu 14.04、DGX OS |
| 网络 | 所有节点需在同一局域网(LAN)内,且相互可访问。运行时不强制联网,但下载模型时需要。 |
注意:低于RTX 20系列的老显卡,或低于M4芯片的旧款Mac,均不支持。
2. 安装 PAIR
2.1 下载安装包
访问项目 GitHub Releases 页面 下载对应你操作系统的最新版本。
| 操作系统 | 安装包类型 | 说明 |
|---|---|---|
| Windows | .exe 安装程序 |
签名安装包,会自动设置防火墙规则和后台服务 |
| macOS | .dmg 磁盘映像 |
下载后拖拽至“Applications”文件夹即可 |
| Linux | .deb 包 |
适用于Debian/Ubuntu系统 |
2.2 执行安装
Windows: 双击运行下载的
.exe文件,按照提示完成安装。macOS: 打开
.dmg文件,将NVIDIA Personal AI Router图标拖拽到Applications文件夹中。Linux (Debian/Ubuntu): 在终端中切换到下载目录,执行以下命令安装:
1
sudo apt install ./NVPAIR-Setup-*.deb
3. 初始配置与单节点运行
3.1 启动 PAIR 并完成初始化
- 像启动普通应用一样打开 PAIR(Windows开始菜单、macOS启动台等)。
- 首次启动需要等待后台服务就绪。当界面从“Loading…”变为显示本机信息时,表示服务已启动。
3.2 配置推理引擎与模型
PAIR本身不执行推理,它需要依赖本地的推理引擎。目前支持 Ollama 和 LM Studio。
- 在PAIR主界面本机的卡片上,点击 Engine settings(引擎设置)。
- 在Ollama或LM Studio旁边,点击 Install(安装)。PAIR会自动下载并为你设置好引擎。如果你已经自行安装了某个引擎,直接点击启动即可。
- 引擎启动后,点击 Add model(添加模型)并下载一个模型,例如
qwen4:12b。
3.3 发送第一个测试请求
你可以通过PAIR内置的测试功能来验证一切是否正常。
方法一(图形界面):进入 Settings → Service,点击 Test 按钮。PAIR会发送一分钟的推理请求来模拟负载,你可以在 Jobs 页面看到任务被执行。
方法二(命令行):在你的终端中执行以下
curl命令(确保使用PAIR的Ollama兼容代理端口,默认为11434)。1
2
3curl http://127.0.0.1:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"qwen4:12b","messages":[{"role":"user","content":"用一句话解释路由器的作用。"}]}'如果一切正常,你会收到一个包含模型回答的JSON响应。
4. 组建集群:多节点部署
将多台设备组成集群是PAIR的核心能力。
- 确保所有节点准备就绪:在每台要加入集群的设备上,重复上述 第3节 的步骤,完成PAIR的安装、引擎配置和模型下载。
- 发起配对:在作为“主控”的节点上,进入 Settings → Cluster(集群)。
- 获取配对码:点击邀请新节点,屏幕上会显示一个6位数字的PIN码。
- 加入集群:在要加入的另一台节点上,同样进入 Settings → Cluster,输入主控节点上显示的PIN码。配对请求通过后,该节点就加入了集群。
- 验证集群:集群建立后,主控节点的界面上会显示所有已连接的节点。现在,你发送的每个独立推理请求,PAIR都会根据各节点的引擎支持、模型存在性和当前负载情况,自动路由到最合适的节点上执行。
5. 关键配置与端口说明
PAIR使用一系列端口进行节点发现和通信。了解这些端口对故障排查有帮助,特别是使用防火墙的Linux系统。
| 端口 | 协议 | 用途 |
|---|---|---|
11434 |
TCP | Ollama兼容代理端口。你的应用应连接到此端口。 |
1234 |
TCP | LM Studio / OpenAI兼容代理端口。 |
5353 |
UDP | mDNS。用于在局域网内自动发现其他节点。 |
14318-14323 |
TCP | 节点间通信。用于传输硬件库存、工作负载、配对等数据。 |
重要:在Windows上,安装程序会自动添加防火墙规则。在Linux上,如果启用了防火墙(如
ufw),你需要手动放行上述端口(尤其是14318-14323和UDP5353)。
6. 故障排查与注意事项
- 服务无法启动:如果界面一直显示“Loading…”,请进入 Settings → Service 查看状态信息。
- 节点无法发现或被找到:检查所有节点是否在同一局域网且在同一子网。确保mDNS (UDP 5353) 未被防火墙阻断。
- 请求路由失败:
- 确认目标节点上已安装并启动了所需的推理引擎(Ollama/LM Studio)。
- 确认目标节点上已下载了请求中指定的模型。
- 数据隐私:PAIR设计为所有流量(提示词、文件、上下文)仅存在于你的局域网内,不会发送到云端。节点间通信通过mTLS证书加密。
- 资源占用与弹性:PAIR的设计考虑到了家庭网络的动态性。节点可以随时离开或加入集群。如果某台设备正被用于游戏或渲染等高GPU负载任务,调度器会自动避开它。
请记住,PAIR当前为公开测试版(Beta),可能会遇到一些不完善的地方。如果你有关于产品方向或功能的想法,可以在GitHub仓库中提出Issue进行讨论。



