NVIDIA Personal AI Router (PAIR) 详细部署教程

NVIDIA Personal AI Router (PAIR) 是一款开源的本地AI推理路由器,能将家庭网络中的多台兼容设备(如RTX PC、DGX Spark、Mac)组成一个AI集群,自动将推理请求分发到负载较低的节点上,从而加速多智能体等并行工作负载。本教程将介绍其部署与使用方法。


1. 系统概述与准备工作

PAIR的核心价值在于将局域网内闲置的算力利用起来,尤其适合多智能体(Multi-Agent)工作流中大量并发的推理请求。它不会将多个GPU合并为一个虚拟GPU,也不会拆分单个推理请求,而是将每个独立的请求路由到最合适的节点上执行。

在开始部署前,请确保你的硬件满足要求。这是最关键的一步,PAIR对硬件有明确的型号门槛,并非任意一台电脑都可以参与。

硬件要求 支持型号
GPU(Windows/Linux) NVIDIA GeForce RTX 20系列及更新型号、RTX PRO工作站GPU(图灵架构起)、NVIDIA DGX Spark/GB10
芯片(macOS) Apple M4芯片及更新型号
内存 8 GB 或以上
磁盘空间 推荐 20 GB 或以上(用于存放模型和日志)
操作系统 Windows 11、macOS Tahoe、Ubuntu 14.04、DGX OS
网络 所有节点需在同一局域网(LAN)内,且相互可访问。运行时不强制联网,但下载模型时需要。

注意:低于RTX 20系列的老显卡,或低于M4芯片的旧款Mac,均不支持。


2. 安装 PAIR

2.1 下载安装包

访问项目 GitHub Releases 页面 下载对应你操作系统的最新版本。

操作系统 安装包类型 说明
Windows .exe 安装程序 签名安装包,会自动设置防火墙规则和后台服务
macOS .dmg 磁盘映像 下载后拖拽至“Applications”文件夹即可
Linux .deb 适用于Debian/Ubuntu系统

2.2 执行安装

  • Windows: 双击运行下载的 .exe 文件,按照提示完成安装。

  • macOS: 打开 .dmg 文件,将 NVIDIA Personal AI Router 图标拖拽到 Applications 文件夹中。

  • Linux (Debian/Ubuntu): 在终端中切换到下载目录,执行以下命令安装:

    1
    sudo apt install ./NVPAIR-Setup-*.deb

3. 初始配置与单节点运行

3.1 启动 PAIR 并完成初始化

  1. 像启动普通应用一样打开 PAIR(Windows开始菜单、macOS启动台等)。
  2. 首次启动需要等待后台服务就绪。当界面从“Loading…”变为显示本机信息时,表示服务已启动。

3.2 配置推理引擎与模型

PAIR本身不执行推理,它需要依赖本地的推理引擎。目前支持 OllamaLM Studio

  1. 在PAIR主界面本机的卡片上,点击 Engine settings(引擎设置)。
  2. 在Ollama或LM Studio旁边,点击 Install(安装)。PAIR会自动下载并为你设置好引擎。如果你已经自行安装了某个引擎,直接点击启动即可。
  3. 引擎启动后,点击 Add model(添加模型)并下载一个模型,例如 qwen4:12b

3.3 发送第一个测试请求

你可以通过PAIR内置的测试功能来验证一切是否正常。

  • 方法一(图形界面):进入 Settings → Service,点击 Test 按钮。PAIR会发送一分钟的推理请求来模拟负载,你可以在 Jobs 页面看到任务被执行。

  • 方法二(命令行):在你的终端中执行以下 curl 命令(确保使用PAIR的Ollama兼容代理端口,默认为 11434)。

    1
    2
    3
    curl http://127.0.0.1:11434/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{"model":"qwen4:12b","messages":[{"role":"user","content":"用一句话解释路由器的作用。"}]}'

    如果一切正常,你会收到一个包含模型回答的JSON响应。


4. 组建集群:多节点部署

将多台设备组成集群是PAIR的核心能力。

  1. 确保所有节点准备就绪:在每台要加入集群的设备上,重复上述 第3节 的步骤,完成PAIR的安装、引擎配置和模型下载。
  2. 发起配对:在作为“主控”的节点上,进入 Settings → Cluster(集群)。
  3. 获取配对码:点击邀请新节点,屏幕上会显示一个6位数字的PIN码。
  4. 加入集群:在要加入的另一台节点上,同样进入 Settings → Cluster,输入主控节点上显示的PIN码。配对请求通过后,该节点就加入了集群。
  5. 验证集群:集群建立后,主控节点的界面上会显示所有已连接的节点。现在,你发送的每个独立推理请求,PAIR都会根据各节点的引擎支持、模型存在性和当前负载情况,自动路由到最合适的节点上执行。

5. 关键配置与端口说明

PAIR使用一系列端口进行节点发现和通信。了解这些端口对故障排查有帮助,特别是使用防火墙的Linux系统。

端口 协议 用途
11434 TCP Ollama兼容代理端口。你的应用应连接到此端口。
1234 TCP LM Studio / OpenAI兼容代理端口
5353 UDP mDNS。用于在局域网内自动发现其他节点。
14318-14323 TCP 节点间通信。用于传输硬件库存、工作负载、配对等数据。

重要:在Windows上,安装程序会自动添加防火墙规则。在Linux上,如果启用了防火墙(如ufw),你需要手动放行上述端口(尤其是14318-14323和UDP 5353)。


6. 故障排查与注意事项

  • 服务无法启动:如果界面一直显示“Loading…”,请进入 Settings → Service 查看状态信息。
  • 节点无法发现或被找到:检查所有节点是否在同一局域网且在同一子网。确保mDNS (UDP 5353) 未被防火墙阻断。
  • 请求路由失败
    • 确认目标节点上已安装并启动了所需的推理引擎(Ollama/LM Studio)。
    • 确认目标节点上已下载了请求中指定的模型。
  • 数据隐私:PAIR设计为所有流量(提示词、文件、上下文)仅存在于你的局域网内,不会发送到云端。节点间通信通过mTLS证书加密。
  • 资源占用与弹性:PAIR的设计考虑到了家庭网络的动态性。节点可以随时离开或加入集群。如果某台设备正被用于游戏或渲染等高GPU负载任务,调度器会自动避开它。

请记住,PAIR当前为公开测试版(Beta),可能会遇到一些不完善的地方。如果你有关于产品方向或功能的想法,可以在GitHub仓库中提出Issue进行讨论。