NVIDIA PAIR 上手指南:把家里 RTX 和 Mac 拼成局域网 AI 推理集群,多 Agent 任务提速 2 倍

一、从一台电脑到一屋子电脑:为什么本地多机推理突然变香了

读者群里跑过 Ollama 或 LM Studio 的朋友应该都有过这个时刻——本地模型刚跑起来,几分钟就被家里的 GPU 显存和电源功率卡死。尤其当你用一套 Agent 框架同时跑 5 个 subagent(写代码、查资料、做摘要、跑测试、回写报告),所有请求都挤在同一个 Ollama 实例的同一张 RTX 卡上,队列长度肉眼可见地上去,等 20 分钟是常事。

NVIDIA 在 9 月 3 日丢出了一个开源(Apache 2.0)、不挑硬件的解法:Personal AI Router(PAIR)。它不是新的推理引擎——不动 Ollama 一行代码;也不是新的模型——你还是跑 Qwen、gpt-oss、DeepSeek 那些已有模型。它是介于你的 Agent 和后端推理引擎之间的虚拟路由器:把独立的推理请求按”哪个节点空就发哪个节点”的策略,发给你家局域网里其他开启了 Ollama / LM Studio 的电脑。

NVIDIA 官方博客给出的对比数据很直观:5 个 subagent 跑 Hermes Desktop + Ollama + Qwen3.6 35B-A3B:

部署方式完成时间
单 RTX Spark 笔记本18 分钟
3 台 PAIR 集群(RTX Spark + DGX Spark + RTX 5090)8 分 48 秒

不是 3 台减到 1/3,而是 2.1 倍提速——因为多出来的两台机器并不是同时处理同一个请求(PAIR 不切分单次推理),它们在并行消耗独立的请求队列。这恰好是本地 Agent 多任务场景的”完美形状”:每个子任务彼此独立,谁先空就先跑谁。

对读者的实际意义:你家里那台闲置的 M4 MacBook、用了几年的 RTX 3060 旧机、给娃上网课用的 RTX PRO 工作站,都可以无缝加入这个”个人 AI 集群”,不需要再买一张新 GPU。

这篇文章,我会带你把这套集群一步步搭起来:PAIR 安装 → mDNS 自动发现 → PIN 配对 → Ollama/LM Studio 配置 → 拆解官方 5-subagent 提速演示 → 三条不踩坑的经验。说明一下:PAIR 目前还在 beta 阶段,本文所有性能数据均来自 NVIDIA 官方博客及公开资料,尚未经独立第三方复测;你完全可以按文中的命令在自己的机器上跑一遍验证。

二、PAIR 到底是什么?一句话讲清架构

PAIR 是 NVIDIA 开源的 Personal AI Router(个人 AI 路由器),结构上是个轻量代理层。它做四件事:

  1. 代理 Ollama 和 LM Studio 默认端口——你的 agent 代码不需要任何改动,照样指向 http://localhost:11434(Ollama)或 LM Studio 默认端口即可;
  2. mDNS 发现局域网里其他装 PAIR 的节点,并支持手动按 IP 添加;
  3. mTLS 双向认证 + 6 位 PIN 配对,保证邻居的设备不会被陌生人蹭用;
  4. 按请求粒度调度:每来一个新请求,PAIR 拿到 engine、model 名称,挑一个”刚好空着 + 装了对应模型”的节点,把请求整包发过去;该节点跑完全部推理,再把结果原路返回。

不会做的事也比做的重要,必须先讲明白:

  • 不会把多张显卡合并成一个虚拟大卡——单次推理请求 永远只跑在一台机器的一个 GPU 上;
  • 不会切分单个请求到多台机器——70B 模型要 48GB 显存还是得 48GB 显存;
  • 不会替你优化网络——要走同一局域网,千兆有线比 Wi-Fi 6 强不少;
  • 不会自动适配驱动——节点本身要满足 Ollama/LM Studio 各自的硬件要求。

这也是为什么我把 PAIR 称作”形状对得上的解药”:它对任务之间天然独立的多 Agent 工作流效果最好;对单个巨模型推理帮助接近零——后者还是得靠本地 GPU 升级或云端 API。

三、硬件兼容清单:先看你家电脑够不够格

PAIR beta 阶段官方支持清单如下(划重点):

设备类型最低配置推荐配置
NVIDIA GeForce RTXRTX 20 系列起步RTX 40/50 系列
NVIDIA RTX PRO 工作站Turing 架构起步Ada / Blackwell 架构
NVIDIA DGX Spark / GB10全支持
Apple Silicon MacM4 及更新M4 Pro / Max / Ultra
系统Windows 11 / Linux / macOS
内存8 GB RAM16 GB+
硬盘20 GB+ 推荐50 GB+(模型文件)
网络同一局域网千兆有线

不踩坑提醒 1Apple Silicon Mac 必须 M4 及以上。M1/M2/M3 不在 beta 支持范围——这是 NVIDIA 官方博客明确写的。家里有几台老 Mac Mini 的同学不要冲动,要先看芯片型号。

不踩坑提醒 2Windows on ARM 是实验性支持。如果你的笔记本是 Surface Pro X 或骁龙 X Elite,beta 阶段可能起不来;建议用一台 x86 机器做主控。

不踩坑提醒 3存储是隐形门槛。每个节点都要预留模型权重空间(Qwen3.6 35B-A3B 量化版约 20GB,gpt-oss-20B 约 12GB)。如果你家三台机器各跑一个不同模型,很快就被塞满——PAIR 调度时是按”模型存在哪台机器”挑节点,所以模型去重差异化部署要提前想清楚。

四、三步把家里电脑拼成集群

4.1 安装 PAIR

官方提供三种安装方式:图形界面(Windows / macOS)、命令行界面、所有平台都支持源码安装。命令行方式能自动化也方便排查问题,下面以它为例。

运行环境:所有命令需要 Python 3.10+(推荐 3.11/3.12);Ubuntu 22.04、macOS 14+、Windows 11 22H2 为官方支持平台。

Bash
# 方法 1:源码构建(推荐开发者,跨平台一致)
git clone https://github.com/NVIDIA/Personal-AI-Router.git
cd Personal-AI-Router
pip install -e .

# 方法 2:NVIDIA 官方签名安装器
# 1. 访问 https://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/
# 2. 下载对应平台的 .deb / .pkg / .msi
# 3. Windows / macOS 双击安装,Ubuntu:
sudo dpkg -i personal-ai-router_*_amd64.deb

4.2 让节点互相发现并配对

PAIR 用 mDNS 多播自动发现同一局域网里的其他 PAIR 节点。每个节点首次启动会广播自己的设备名 + 端点。同时也支持手动按 IP 添加(适合家用网络开了 mDNS 阻断的环境,比如某些企业级路由器)。

Bash
# 在每台机器上分别启动 PAIR 守护进程
pairctl daemon start

# 查看局域网里其他 PAIR 节点
pairctl discover
# 预期输出(节点名是你的电脑名):
# DISCOVERED  3 nodes
#   mac-studio-mini    192.168.1.42  :11434  RTX 4090 (24GB)
#   rtx-pc-server      192.168.1.18  :11434  RTX 5090 (32GB)
#   dg-x-spark         192.168.1.7   :11435  GB10

# 发起配对请求(PIN 码在对方 PAIR 客户端里查看)
pairctl pair mac-studio-mini --pin=842193

配对安全机制值得停下来多说两句:

  • 未配对节点之间 mTLS 通道默认全封——只允许本地 loopback 请求;
  • 配对靠 6 位数字 PIN,需要对方在 PAIR 客户端里手动确认;
  • 配对完成后双方会生成自签证书,所有后续通信都走 mTLS;
  • 已配对节点列表保存在 ~/.pairctl/peers.json,可随时用 pairctl peers --remove=<id> 撤回授权。

4.3 让 Ollama / LM Studio 跑起来

PAIR 不替代 Ollama/LM Studio,只代理它们的端口。所以每台节点必须独立安装并启动至少一个推理后端。最小可行配置如下:

Bash
# 在所有节点上(如果你还没装 Ollama)
curl -fsSL https://ollama.com/install.sh | sh
ollama serve &  # 默认监听 11434

# 拉一个 7B 量化模型做轻量任务
ollama pull qwen3.6:8b-instruct-q4_K_M

# 在较猛的节点上拉更大的 35B 量化模型
ollama pull qwen3.6:35b-a3b-instruct-q4_K_M

LM Studio 同理,启动 server 模式即可(默认端口 1234)。PAIR 会自动检测节点上跑了哪些 engine、加载了哪些模型。

最后一步:把 PAIR 的”代理-路由模式”打开,让它真的开始分发请求:

Bash
# 启用 Ollama 端口代理(默认 11434)
pairctl proxy enable --engine=ollama

# 同时启用 LM Studio 端口代理(默认 1234)
pairctl proxy enable --engine=lm-studio

# 启动路由器
pairctl route enable

不踩坑提醒 4如果你的 agent 用了非默认端口,要在 PAIR 引擎配置里改:

Bash
pairctl config set proxy.ollama_port 21566

否则 PAIR 会和原来的 Ollama 实例抢 11434 端口,Ollama 直接起不来。

五、官方演示拆解:5 个 subagent 任务为什么能快一倍

NVIDIA 官方演示用的任务形态很贴近日常:一个 lead agent 拆出 5 个独立 subagent,分别做读文件提取要点、改函数、解释类型签名、生成单元测试、翻译文档这类互不依赖的子任务,全部跑在 Hermes Desktop + Ollama + Qwen3.6 35B-A3B(Q4_K_M)上。

部署完成总耗时备注
单 RTX Spark 笔记本(不开 PAIR)18 分钟队列排队,GPU 满载
3 台 PAIR 集群(RTX Spark + DGX Spark + RTX 5090)8 分 48 秒三节点并行消化独立子任务

三台机器并没有跑出理论上的 3 倍,官方演示里是 2.1 倍。原因也不难理解:

  • 节点之间网络往返会吃掉一部分时间;
  • 三台机器的推理速度不同,整个任务的最长链路(最慢的那台机器)决定最终耗时;
  • PAIR 按”模型在哪台机器上”路由,如果某个子任务需要的模型只有一台机器有,其他节点就帮不上忙。

所以官方也强调,这只是特定配置下的演示数据,不是通用基准。真实提速取决于你的任务并行度、模型分布和网络质量。如果你的多台节点都装了同一个模型、跑的是大量互不依赖的子任务,理论上更接近线性扩展;反之如果你的工作流是单条长对话,PAIR 帮不上什么忙。

六、三条不踩坑的本地多机推理经验

结合官方文档和社区讨论,有三条经验值得在动手前先记住:

经验 1:把”模型分布策略”当作数据库分片来设计。
PAIR 的调度器只会选”已经装了对应模型的节点”,所以模型去重差异化部署要提前想。一个省心的策略是:

  • 主力 RTX PC:跑 70B 级大模型(Qwen3.6 35B-A3B Q4);
  • 备用 Mac(M4 Pro):专门跑 8B-14B 小模型;
  • 老 RTX 3060 笔记本:跑 7B 量化版的 code 模型(Qwen2.5-Coder-7B)。

不要把同一个 35B 模型在三台机器上都拉一遍——浪费存储且调度器没有任何收益。

经验 2:mDNS 在企业网络可能被屏蔽,家里一般没这个问题。
家用路由器默认通常放行 mDNS(5353/UDP 多播);但如果你在公司 VLAN 或开了 AP 隔离的访客网络里,设备互相发现会失败。PAIR 提供了 IP 手动添加作为兜底:

Bash
pairctl peers add --ip=192.168.1.42 --name=mac-studio

经验 3:beta 阶段不要拿它做生产级 SLA 工作流。
NVIDIA 自己也说”不保证一致延迟与吞吐”。PAIR 适合非延迟敏感的批处理、夜间自动化、研究探索。不适合:高频实时聊天对话(要先等调度时间)、关键业务的工作流(掉线可能丢请求)。后者还是老老实实上云或单机。

七、它和云端 API 是替代关系吗?算笔账

PAIR 不是云端的替代品,而是互补品。一个常见的使用策略是:

  • 草稿、探索、低优先级任务 → 本地 PAIR 集群跑;
  • 关键路径、要 SLA、要长上下文 → 切到 GPT-6 Astra / Claude Fable 5.1 / Gemini 3.8 Flash API。

如果全部走云端,按照 GPT-6 Astra ~$10/$50 per MTok、Claude Fable 5.1 输入 $10 输出 $50 per MTok 的报价(来源:Anthropic 定价页),一个 5 subagent 任务平均消耗约 80k 输入 + 12k 输出 token,单次成本约 $1.4。OpenCode 这套任务一个月跑 50 次就是 $70,半年就够买一台中端 RTX 显卡——这也是越来越多本地 Agent 玩家开始攒多机的原因之一。

另外,本地 PAIR 走的是局域网——完全不上传数据,对内部代码、企业内部文档这类有合规需求的场景也友好。

八、读完你可以做什么

如果你……推荐步骤
第一次接触本地 AI先读完 本地部署大模型完全指南:Ollama 与 LM Studio 实战对比,把单机跑通再回来
已经本地跑过 Ollama直接装 PAIR,跳过 Ollama 部署部分
家里有 RTX + Mac 混合环境重点看第四节 4.2——配对流程
想跑完整 Agent 框架DeepSeek Harness 开源框架指南OpenAI Codex Harness 上手指南,把它们的 Ollama endpoint 指到 PAIR 代理的 11434
数据合规要求高重点看第六节”不踩坑经验 3″ + 第七节本地 vs 云端成本对比

参考链接

站内延伸阅读:

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

推荐阅读

  • NVIDIA PAIR 上手指南:把家里 RTX 和 Mac 拼成局域网 AI 推理集群,多 Agent 任务提速 2 倍

    NVIDIA 9 月 3 日开源的 PAIR 让你不动 Ollama / LM Studio 接口就能把家里几台电脑拼成局域网 AI 推理集群,5 个 subagent 任务从 18 分钟压到 8 分…

  • Claude Fable 5.1 发布:8 项基准屠榜、缓存降价 75%,但升级前先改这三处代码

    Claude Fable 5.1 发布:8 项基准屠榜,缓存读取直降 75%,但升级前必须改三处代码——tool_choice 返回 400、thinking blocks 跨模型失效、编辑 syst…

  • 腾讯混元 Hy4 preview 开源上手:770B/49B MoE、1M 上下文,5 行代码跑通 API 调用与编程实测

    腾讯混元 Hy4 preview 开源:770B/49B MoE,1M 上下文,Apache 2.0。教你用 5 行 Python 通过 OpenRouter 调用 API,用 reasoning_e…

  • vLLM v0.28.0 上手指南:从 pip install 到 60% 提速,一篇说清 Kimi-K3、DeepSeek V4 与 7 项 Breaking Changes

    vLLM v0.28.0(8 月 26 日发布):584 commit、Kimi-K3 TTFT 升 60%、每 GPU 省 17 GiB、DeepSeek V4 sparse MLA 端到端。本文实…