NVIDIA PAIR是一款由英伟达推出的本地 AI 推理路由工具,主要用于把多台设备上的本地推理算力编成统一可调度的资源池,支持跨设备自动分发推理请求、本地数据不出局域网,适用于有多张显卡又想提升本地推理吞吐的个人开发者与小型团队。
| 基础信息 | 内容 |
|---|---|
| 产品定位 | 本地 AI 推理路由器(虚拟推理路由层) |
| 出品方 | 英伟达 NVIDIA |
| 发布时间 | 2026年9月3日(IFA 2026,免费公测) |
| 支持引擎 | Ollama、LM Studio |
| 支持系统 | Windows、macOS、Linux |
| 支持硬件 | GeForce RTX 20 系及以上、RTX PRO、DGX Spark、Apple M4+ |
| 开源与价格 | 免费、开源(beta,GitHub 托管) |

NVIDIA PAIR 的核心能力
虚拟推理路由
PAIR 本质不是新的推理引擎,而是部署在代理层的虚拟推理路由器。它代理 Ollama 与 LM Studio 的本地接口,对上层应用呈现为单一连接,实际把每个请求分发到合适的节点,你已有的 Agent 与客户端无需改造即可接入。
弹性节点池
兼容设备空闲时自动加入资源池,休眠、关机或投入前台工作时自动退出,无需固定集群拓扑。家用 RTX 主机、工作站、DGX Spark 可以混编进同一个资源池,降低组建本地集群的门槛。
本地数据优先
提示词、数据与推理流量始终留在用户既有局域网内,不上云。对数据合规与隐私敏感的场景尤其合适,也避免了把本地任务发送到第三方服务的额外延迟。
安全配对
通过 mDNS 自动发现局域网设备,节点间以 mTLS 与自动生成证书加密,未配对前流量相互隔离。配对在界面里一键批准,不需要手动交换密钥。
实时调度
依据节点就绪状态、引擎类型、模型是否已驻留、GPU 利用率等信号为每个请求选择执行节点,避免把任务压到正在忙的单卡上。路由对上层透明,调用方感知不到后端是哪台设备。
作为英伟达本地 AI 布局的一环,PAIR 与 Nemotron 3 Super 等开源模型、NemoClaw 企业级智能体平台共同构成从端侧推理到 agent 安全的完整生态。这种「路由而非聚合」的设计,意味着它不要求所有设备显存一致,普通家用显卡与专业卡也能混编进同一个池子。
NVIDIA PAIR 与相近方案的对比
PAIR 是部署在代理层的请求路由,不直接替代任何本地推理引擎——它把 Ollama、LM Studio 这类引擎的接口代理出来,让多台设备组成统一资源池。先看英伟达官方给出的性能演示,再把它与两种容易被混为一谈的本地算力方案放在一张表里区分。
英伟达用 Hermes Desktop 跑了一个五子智能体工作流(Qwen 3.6 35B A3B 经 Ollama 运行):单台 RTX Spark 笔记本平均 18 分钟完成,三设备 PAIR 集群(RTX Spark 笔记本 + DGX Spark + RTX 5090)平均 8 分 48 秒,约 2 倍加速。英伟达明确声明这是配置特定的非正式演示,结果会随工作流并行度、模型、硬件、网络条件浮动。
| 对比维度 | NVIDIA PAIR | GPU 池化 | 模型分片 |
|---|---|---|---|
| 解决的问题 | 多机并发请求排队 | 单卡显存装不下大模型 | 单卡算力跑不动大模型 |
| 核心机制 | 代理层路由独立请求 | 合并多卡显存为一个逻辑 GPU | 把模型权重切分到多机 |
| 是否合并显存 | 否 | 是 | 否 |
| 是否拆分单个模型 | 否 | 否 | 是 |
| 单个请求是否跨设备 | 否(一请求一节点) | 是 | 是 |
| 性能收益来源 | 请求级并发 | 单请求内存扩展 | 单请求算力扩展 |
| 代表方案 | 英伟达首创 | exo(exolabs 开源) | Petals(BigScience 开源) |
这套机制划定了 PAIR 的价值边界:它适合已有两台以上设备、且常跑多智能体并发工作流的场景,不适合想用多台机器合力跑一个超大模型的场景(那是 GPU 池化与模型分片的活)。要真正跑起来,PAIR 需要一台装了本地推理引擎的设备——它首发代理的 Ollama(免费开源的本地大模型运行器,支持 Llama、Qwen 等大量开源模型)就是最常用的一步。
NVIDIA PAIR 的应用场景与适用人群
NVIDIA PAIR 在这些本地推理场景里最有用:
- 多智能体并发推理:主 Agent 把任务拆给多个子智能体同时调用模型时,PAIR 把并发请求分散到不同节点,避免单卡排队。
- 闲置设备算力复用:书房游戏主机、工位工作站、DGX Spark 等白天空闲的设备,可在你办公或游戏时被调度参与推理。
- 主设备专注前台任务:把推理流量引到别的节点,让主力 RTX PC 继续流畅打游戏、做剪辑或其他交互工作。
适用人群:适合拥有两台及以上 AI capable 设备、常在本地跑智能体或多智能体工作流的个人开发者、AI 爱好者和小型团队;也适合希望用既有硬件提升本地推理吞吐、又不愿重构 Agent 架构的本地 AI 玩家。类似 Kimi Work 这类本地 AI Agent 客户端,也能在单台设备上承接部分推理任务。
如何使用 NVIDIA PAIR
开始前确认:两台及以上同局域网设备(Windows、macOS、Linux 均可),节点显卡为 GeForce RTX 20 系及以上或 Apple M4+,且每台已装好并运行 Ollama 或 LM Studio。准备就绪后按以下步骤接入:
- 下载安装:从 NVIDIA PAIR 官方仓库 获取公测版(Windows/macOS 安装包或 Linux 包),在每台参与设备上安装并启动。
- 发现节点:PAIR 通过 mDNS 自动发现同网段设备,也可手动按 IP 添加节点,组成局域网内的推理资源池。
- 审批配对:在界面中批准安全配对请求,节点间建立 mTLS 加密信任,未批准的设备无法加入调度。
- 指向代理:将你的 Agent、客户端或脚本的连接地址改为 PAIR 暴露的本地代理端口(默认走 Ollama 兼容接口),上层代码无需改动。
- 开始推理:像平时一样发起请求,PAIR 会把每个请求调度到当前合适的节点,提示词与调用逻辑保持不变。
NVIDIA PAIR 的价格与开源情况
PAIR 是英伟达发布的免费、开源公测软件,源码托管在 GitHub,使用不产生费用。它不绑定任何商业推理服务,也不要求订阅;你只需自备支持 CUDA 或 Apple 芯片的硬件。由于 PAIR 只做路由、不替换你已有的 Ollama 与 LM Studio,模型权重与显存成本完全由你现有的本地部署决定,PAIR 本身不额外收费,也没有按量计费或调用上限。
NVIDIA PAIR 常见问题
PAIR 会聚合多张显卡的显存吗?
不会。PAIR 不池化显存、不切分模型,每个推理请求只分配给一个合格节点并在该节点完成。它带来的是并发调度收益,而非单卡算力放大。
PAIR 支持哪些推理引擎?
首发支持 Ollama 与 LM Studio。PAIR 通过代理它们的本地接口工作,因此现有 Agent 与客户端无需改造即可接入。
至少需要几台设备?
至少两台处于同一局域网的设备即可组成集群;更多设备能进一步提升并发吞吐,但数量并不构成功能门槛。
PAIR 收费吗?
不收费。PAIR 是英伟达发布的免费、开源公测软件,源码托管在 GitHub,使用不产生费用。
支持哪些硬件?
支持 NVIDIA GeForce RTX 20 系及以上显卡、RTX PRO 工作站显卡、DGX Spark,以及 Apple M4 或更新芯片的 Mac;Windows on Arm 支持为实验性。
浙公网安备33010202004812号