一、从一台电脑到一屋子电脑:为什么本地多机推理突然变香了
读者群里跑过 Ollama 或 LM Studio 的朋友应该都有过这个时刻——本地模型刚跑起来,几分钟就被家里的 GPU 显存和电源功率卡死。尤其当你用一套 Agent 框架同时跑 5 个 subagent(写代码、查资料、做摘要、跑测试、回写报告),所有请求都挤在同一个 Ollama 实例的同一张 RTX 卡上,队列长度肉眼可见地上去,等 20 分钟是常事。
NVIDIA 在 9 月 3 日丢出了一个开源(Apache 2.0)、不挑硬件的解法:Personal AI Router(PAIR)。它不是新的推理引擎——不动 Ollama 一行代码;也不是新的模型——你还是跑 Qwen、gpt-oss、DeepSeek 那些已有模型。它是介于你的 Agent 和后端推理引擎之间的虚拟路由器:把独立的推理请求按”哪个节点空就发哪个节点”的策略,发给你家局域网里其他开启了 Ollama / LM Studio 的电脑。
NVIDIA 官方博客给出的对比数据很直观:5 个 subagent 跑 Hermes Desktop + Ollama + Qwen3.6 35B-A3B:
| 部署方式 | 完成时间 |
|---|---|
| 单 RTX Spark 笔记本 | 18 分钟 |
| 3 台 PAIR 集群(RTX Spark + DGX Spark + RTX 5090) | 8 分 48 秒 |
不是 3 台减到 1/3,而是 2.1 倍提速——因为多出来的两台机器并不是同时处理同一个请求(PAIR 不切分单次推理),它们在并行消耗独立的请求队列。这恰好是本地 Agent 多任务场景的”完美形状”:每个子任务彼此独立,谁先空就先跑谁。
对读者的实际意义:你家里那台闲置的 M4 MacBook、用了几年的 RTX 3060 旧机、给娃上网课用的 RTX PRO 工作站,都可以无缝加入这个”个人 AI 集群”,不需要再买一张新 GPU。
这篇文章,我会带你把这套集群一步步搭起来:PAIR 安装 → mDNS 自动发现 → PIN 配对 → Ollama/LM Studio 配置 → 拆解官方 5-subagent 提速演示 → 三条不踩坑的经验。说明一下:PAIR 目前还在 beta 阶段,本文所有性能数据均来自 NVIDIA 官方博客及公开资料,尚未经独立第三方复测;你完全可以按文中的命令在自己的机器上跑一遍验证。
二、PAIR 到底是什么?一句话讲清架构
PAIR 是 NVIDIA 开源的 Personal AI Router(个人 AI 路由器),结构上是个轻量代理层。它做四件事:
- 代理 Ollama 和 LM Studio 默认端口——你的 agent 代码不需要任何改动,照样指向
http://localhost:11434(Ollama)或 LM Studio 默认端口即可; - mDNS 发现局域网里其他装 PAIR 的节点,并支持手动按 IP 添加;
- mTLS 双向认证 + 6 位 PIN 配对,保证邻居的设备不会被陌生人蹭用;
- 按请求粒度调度:每来一个新请求,PAIR 拿到 engine、model 名称,挑一个”刚好空着 + 装了对应模型”的节点,把请求整包发过去;该节点跑完全部推理,再把结果原路返回。
它不会做的事也比做的重要,必须先讲明白:
- ❌ 不会把多张显卡合并成一个虚拟大卡——单次推理请求 永远只跑在一台机器的一个 GPU 上;
- ❌ 不会切分单个请求到多台机器——70B 模型要 48GB 显存还是得 48GB 显存;
- ❌ 不会替你优化网络——要走同一局域网,千兆有线比 Wi-Fi 6 强不少;
- ❌ 不会自动适配驱动——节点本身要满足 Ollama/LM Studio 各自的硬件要求。
这也是为什么我把 PAIR 称作”形状对得上的解药”:它对任务之间天然独立的多 Agent 工作流效果最好;对单个巨模型推理帮助接近零——后者还是得靠本地 GPU 升级或云端 API。
三、硬件兼容清单:先看你家电脑够不够格
PAIR beta 阶段官方支持清单如下(划重点):
| 设备类型 | 最低配置 | 推荐配置 |
|---|---|---|
| NVIDIA GeForce RTX | RTX 20 系列起步 | RTX 40/50 系列 |
| NVIDIA RTX PRO 工作站 | Turing 架构起步 | Ada / Blackwell 架构 |
| NVIDIA DGX Spark / GB10 | 全支持 | — |
| Apple Silicon Mac | M4 及更新 | M4 Pro / Max / Ultra |
| 系统 | Windows 11 / Linux / macOS | — |
| 内存 | 8 GB RAM | 16 GB+ |
| 硬盘 | 20 GB+ 推荐 | 50 GB+(模型文件) |
| 网络 | 同一局域网 | 千兆有线 |
不踩坑提醒 1:Apple Silicon Mac 必须 M4 及以上。M1/M2/M3 不在 beta 支持范围——这是 NVIDIA 官方博客明确写的。家里有几台老 Mac Mini 的同学不要冲动,要先看芯片型号。
不踩坑提醒 2:Windows on ARM 是实验性支持。如果你的笔记本是 Surface Pro X 或骁龙 X Elite,beta 阶段可能起不来;建议用一台 x86 机器做主控。
不踩坑提醒 3:存储是隐形门槛。每个节点都要预留模型权重空间(Qwen3.6 35B-A3B 量化版约 20GB,gpt-oss-20B 约 12GB)。如果你家三台机器各跑一个不同模型,很快就被塞满——PAIR 调度时是按”模型存在哪台机器”挑节点,所以模型去重和差异化部署要提前想清楚。
四、三步把家里电脑拼成集群
4.1 安装 PAIR
官方提供三种安装方式:图形界面(Windows / macOS)、命令行界面、所有平台都支持源码安装。命令行方式能自动化也方便排查问题,下面以它为例。
运行环境:所有命令需要 Python 3.10+(推荐 3.11/3.12);Ubuntu 22.04、macOS 14+、Windows 11 22H2 为官方支持平台。
# 方法 1:源码构建(推荐开发者,跨平台一致)
git clone https://github.com/NVIDIA/Personal-AI-Router.git
cd Personal-AI-Router
pip install -e .
# 方法 2:NVIDIA 官方签名安装器
# 1. 访问 https://www.nvidia.com/en-us/ai-on-rtx/personal-ai-router/
# 2. 下载对应平台的 .deb / .pkg / .msi
# 3. Windows / macOS 双击安装,Ubuntu:
sudo dpkg -i personal-ai-router_*_amd64.deb4.2 让节点互相发现并配对
PAIR 用 mDNS 多播自动发现同一局域网里的其他 PAIR 节点。每个节点首次启动会广播自己的设备名 + 端点。同时也支持手动按 IP 添加(适合家用网络开了 mDNS 阻断的环境,比如某些企业级路由器)。
# 在每台机器上分别启动 PAIR 守护进程
pairctl daemon start
# 查看局域网里其他 PAIR 节点
pairctl discover
# 预期输出(节点名是你的电脑名):
# DISCOVERED 3 nodes
# mac-studio-mini 192.168.1.42 :11434 RTX 4090 (24GB)
# rtx-pc-server 192.168.1.18 :11434 RTX 5090 (32GB)
# dg-x-spark 192.168.1.7 :11435 GB10
# 发起配对请求(PIN 码在对方 PAIR 客户端里查看)
pairctl pair mac-studio-mini --pin=842193配对安全机制值得停下来多说两句:
- 未配对节点之间 mTLS 通道默认全封——只允许本地 loopback 请求;
- 配对靠 6 位数字 PIN,需要对方在 PAIR 客户端里手动确认;
- 配对完成后双方会生成自签证书,所有后续通信都走 mTLS;
- 已配对节点列表保存在
~/.pairctl/peers.json,可随时用pairctl peers --remove=<id>撤回授权。
4.3 让 Ollama / LM Studio 跑起来
PAIR 不替代 Ollama/LM Studio,只代理它们的端口。所以每台节点必须独立安装并启动至少一个推理后端。最小可行配置如下:
# 在所有节点上(如果你还没装 Ollama)
curl -fsSL https://ollama.com/install.sh | sh
ollama serve & # 默认监听 11434
# 拉一个 7B 量化模型做轻量任务
ollama pull qwen3.6:8b-instruct-q4_K_M
# 在较猛的节点上拉更大的 35B 量化模型
ollama pull qwen3.6:35b-a3b-instruct-q4_K_MLM Studio 同理,启动 server 模式即可(默认端口 1234)。PAIR 会自动检测节点上跑了哪些 engine、加载了哪些模型。
最后一步:把 PAIR 的”代理-路由模式”打开,让它真的开始分发请求:
# 启用 Ollama 端口代理(默认 11434)
pairctl proxy enable --engine=ollama
# 同时启用 LM Studio 端口代理(默认 1234)
pairctl proxy enable --engine=lm-studio
# 启动路由器
pairctl route enable不踩坑提醒 4:如果你的 agent 用了非默认端口,要在 PAIR 引擎配置里改:
pairctl config set proxy.ollama_port 21566否则 PAIR 会和原来的 Ollama 实例抢 11434 端口,Ollama 直接起不来。
五、官方演示拆解:5 个 subagent 任务为什么能快一倍
NVIDIA 官方演示用的任务形态很贴近日常:一个 lead agent 拆出 5 个独立 subagent,分别做读文件提取要点、改函数、解释类型签名、生成单元测试、翻译文档这类互不依赖的子任务,全部跑在 Hermes Desktop + Ollama + Qwen3.6 35B-A3B(Q4_K_M)上。
| 部署 | 完成总耗时 | 备注 |
|---|---|---|
| 单 RTX Spark 笔记本(不开 PAIR) | 18 分钟 | 队列排队,GPU 满载 |
| 3 台 PAIR 集群(RTX Spark + DGX Spark + RTX 5090) | 8 分 48 秒 | 三节点并行消化独立子任务 |
三台机器并没有跑出理论上的 3 倍,官方演示里是 2.1 倍。原因也不难理解:
- 节点之间网络往返会吃掉一部分时间;
- 三台机器的推理速度不同,整个任务的最长链路(最慢的那台机器)决定最终耗时;
- PAIR 按”模型在哪台机器上”路由,如果某个子任务需要的模型只有一台机器有,其他节点就帮不上忙。
所以官方也强调,这只是特定配置下的演示数据,不是通用基准。真实提速取决于你的任务并行度、模型分布和网络质量。如果你的多台节点都装了同一个模型、跑的是大量互不依赖的子任务,理论上更接近线性扩展;反之如果你的工作流是单条长对话,PAIR 帮不上什么忙。
六、三条不踩坑的本地多机推理经验
结合官方文档和社区讨论,有三条经验值得在动手前先记住:
经验 1:把”模型分布策略”当作数据库分片来设计。
PAIR 的调度器只会选”已经装了对应模型的节点”,所以模型去重和差异化部署要提前想。一个省心的策略是:
- 主力 RTX PC:跑 70B 级大模型(Qwen3.6 35B-A3B Q4);
- 备用 Mac(M4 Pro):专门跑 8B-14B 小模型;
- 老 RTX 3060 笔记本:跑 7B 量化版的 code 模型(Qwen2.5-Coder-7B)。
不要把同一个 35B 模型在三台机器上都拉一遍——浪费存储且调度器没有任何收益。
经验 2:mDNS 在企业网络可能被屏蔽,家里一般没这个问题。
家用路由器默认通常放行 mDNS(5353/UDP 多播);但如果你在公司 VLAN 或开了 AP 隔离的访客网络里,设备互相发现会失败。PAIR 提供了 IP 手动添加作为兜底:
pairctl peers add --ip=192.168.1.42 --name=mac-studio经验 3:beta 阶段不要拿它做生产级 SLA 工作流。
NVIDIA 自己也说”不保证一致延迟与吞吐”。PAIR 适合非延迟敏感的批处理、夜间自动化、研究探索。不适合:高频实时聊天对话(要先等调度时间)、关键业务的工作流(掉线可能丢请求)。后者还是老老实实上云或单机。
七、它和云端 API 是替代关系吗?算笔账
PAIR 不是云端的替代品,而是互补品。一个常见的使用策略是:
- 草稿、探索、低优先级任务 → 本地 PAIR 集群跑;
- 关键路径、要 SLA、要长上下文 → 切到 GPT-6 Astra / Claude Fable 5.1 / Gemini 3.8 Flash API。
如果全部走云端,按照 GPT-6 Astra ~$10/$50 per MTok、Claude Fable 5.1 输入 $10 输出 $50 per MTok 的报价(来源:Anthropic 定价页),一个 5 subagent 任务平均消耗约 80k 输入 + 12k 输出 token,单次成本约 $1.4。OpenCode 这套任务一个月跑 50 次就是 $70,半年就够买一台中端 RTX 显卡——这也是越来越多本地 Agent 玩家开始攒多机的原因之一。
另外,本地 PAIR 走的是局域网——完全不上传数据,对内部代码、企业内部文档这类有合规需求的场景也友好。
八、读完你可以做什么
| 如果你…… | 推荐步骤 |
|---|---|
| 第一次接触本地 AI | 先读完 本地部署大模型完全指南:Ollama 与 LM Studio 实战对比,把单机跑通再回来 |
| 已经本地跑过 Ollama | 直接装 PAIR,跳过 Ollama 部署部分 |
| 家里有 RTX + Mac 混合环境 | 重点看第四节 4.2——配对流程 |
| 想跑完整 Agent 框架 | 接 DeepSeek Harness 开源框架指南 或 OpenAI Codex Harness 上手指南,把它们的 Ollama endpoint 指到 PAIR 代理的 11434 |
| 数据合规要求高 | 重点看第六节”不踩坑经验 3″ + 第七节本地 vs 云端成本对比 |
参考链接
- NVIDIA 开发者博客首发:NVIDIA PAIR Virtual Inference Router Expands Available Compute on Your Local Network
- GitHub 开源仓库:NVIDIA/Personal-AI-Router
- NVIDIA PAIR beta 下载页:Personal AI Router | NVIDIA
- 第三方深度评测:aicybr – NVIDIA PAIR Beta Routes Ollama and LM Studio Across Local PCs
站内延伸阅读:
发表回复