NVIDIA PAIR – 英伟达推出的本地 AI 推理路由工具

AI工具1天前更新 智小研
24 0

NVIDIA PAIR是一款由英伟达推出的本地 AI 推理路由工具,主要用于把多台设备上的本地推理算力编成统一可调度的资源池,支持跨设备自动分发推理请求、本地数据不出局域网,适用于有多张显卡又想提升本地推理吞吐的个人开发者与小型团队。

基础信息内容
产品定位本地 AI 推理路由器(虚拟推理路由层)
出品方英伟达 NVIDIA
发布时间2026年9月3日(IFA 2026,免费公测)
支持引擎Ollama、LM Studio
支持系统Windows、macOS、Linux
支持硬件GeForce RTX 20 系及以上、RTX PRO、DGX Spark、Apple M4+
开源与价格免费、开源(beta,GitHub 托管)
NVIDIA PAIR – 英伟达推出的本地 AI 推理路由工具

NVIDIA PAIR 的核心能力

虚拟推理路由

PAIR 本质不是新的推理引擎,而是部署在代理层的虚拟推理路由器。它代理 Ollama 与 LM Studio 的本地接口,对上层应用呈现为单一连接,实际把每个请求分发到合适的节点,你已有的 Agent 与客户端无需改造即可接入。

弹性节点池

兼容设备空闲时自动加入资源池,休眠、关机或投入前台工作时自动退出,无需固定集群拓扑。家用 RTX 主机、工作站、DGX Spark 可以混编进同一个资源池,降低组建本地集群的门槛。

本地数据优先

提示词、数据与推理流量始终留在用户既有局域网内,不上云。对数据合规与隐私敏感的场景尤其合适,也避免了把本地任务发送到第三方服务的额外延迟。

安全配对

通过 mDNS 自动发现局域网设备,节点间以 mTLS 与自动生成证书加密,未配对前流量相互隔离。配对在界面里一键批准,不需要手动交换密钥。

实时调度

依据节点就绪状态、引擎类型、模型是否已驻留、GPU 利用率等信号为每个请求选择执行节点,避免把任务压到正在忙的单卡上。路由对上层透明,调用方感知不到后端是哪台设备。

作为英伟达本地 AI 布局的一环,PAIR 与 Nemotron 3 Super 等开源模型、NemoClaw 企业级智能体平台共同构成从端侧推理到 agent 安全的完整生态。这种「路由而非聚合」的设计,意味着它不要求所有设备显存一致,普通家用显卡与专业卡也能混编进同一个池子。

NVIDIA PAIR 与相近方案的对比

PAIR 是部署在代理层的请求路由,不直接替代任何本地推理引擎——它把 Ollama、LM Studio 这类引擎的接口代理出来,让多台设备组成统一资源池。先看英伟达官方给出的性能演示,再把它与两种容易被混为一谈的本地算力方案放在一张表里区分。

英伟达用 Hermes Desktop 跑了一个五子智能体工作流(Qwen 3.6 35B A3B 经 Ollama 运行):单台 RTX Spark 笔记本平均 18 分钟完成,三设备 PAIR 集群(RTX Spark 笔记本 + DGX Spark + RTX 5090)平均 8 分 48 秒,约 2 倍加速。英伟达明确声明这是配置特定的非正式演示,结果会随工作流并行度、模型、硬件、网络条件浮动。

对比维度NVIDIA PAIRGPU 池化模型分片
解决的问题多机并发请求排队单卡显存装不下大模型单卡算力跑不动大模型
核心机制代理层路由独立请求合并多卡显存为一个逻辑 GPU把模型权重切分到多机
是否合并显存
是否拆分单个模型
单个请求是否跨设备否(一请求一节点)
性能收益来源请求级并发单请求内存扩展单请求算力扩展
代表方案英伟达首创exo(exolabs 开源)Petals(BigScience 开源)

这套机制划定了 PAIR 的价值边界:它适合已有两台以上设备、且常跑多智能体并发工作流的场景,不适合想用多台机器合力跑一个超大模型的场景(那是 GPU 池化与模型分片的活)。要真正跑起来,PAIR 需要一台装了本地推理引擎的设备——它首发代理的 Ollama(免费开源的本地大模型运行器,支持 Llama、Qwen 等大量开源模型)就是最常用的一步。

NVIDIA PAIR 的应用场景与适用人群

NVIDIA PAIR 在这些本地推理场景里最有用:

  • 多智能体并发推理:主 Agent 把任务拆给多个子智能体同时调用模型时,PAIR 把并发请求分散到不同节点,避免单卡排队。
  • 闲置设备算力复用:书房游戏主机、工位工作站、DGX Spark 等白天空闲的设备,可在你办公或游戏时被调度参与推理。
  • 主设备专注前台任务:把推理流量引到别的节点,让主力 RTX PC 继续流畅打游戏、做剪辑或其他交互工作。

适用人群:适合拥有两台及以上 AI capable 设备、常在本地跑智能体或多智能体工作流的个人开发者、AI 爱好者和小型团队;也适合希望用既有硬件提升本地推理吞吐、又不愿重构 Agent 架构的本地 AI 玩家。类似 Kimi Work 这类本地 AI Agent 客户端,也能在单台设备上承接部分推理任务。

如何使用 NVIDIA PAIR

开始前确认:两台及以上同局域网设备(Windows、macOS、Linux 均可),节点显卡为 GeForce RTX 20 系及以上或 Apple M4+,且每台已装好并运行 Ollama 或 LM Studio。准备就绪后按以下步骤接入:

  1. 下载安装:从 NVIDIA PAIR 官方仓库 获取公测版(Windows/macOS 安装包或 Linux 包),在每台参与设备上安装并启动。
  2. 发现节点:PAIR 通过 mDNS 自动发现同网段设备,也可手动按 IP 添加节点,组成局域网内的推理资源池。
  3. 审批配对:在界面中批准安全配对请求,节点间建立 mTLS 加密信任,未批准的设备无法加入调度。
  4. 指向代理:将你的 Agent、客户端或脚本的连接地址改为 PAIR 暴露的本地代理端口(默认走 Ollama 兼容接口),上层代码无需改动。
  5. 开始推理:像平时一样发起请求,PAIR 会把每个请求调度到当前合适的节点,提示词与调用逻辑保持不变。

NVIDIA PAIR 的价格与开源情况

PAIR 是英伟达发布的免费、开源公测软件,源码托管在 GitHub,使用不产生费用。它不绑定任何商业推理服务,也不要求订阅;你只需自备支持 CUDA 或 Apple 芯片的硬件。由于 PAIR 只做路由、不替换你已有的 Ollama 与 LM Studio,模型权重与显存成本完全由你现有的本地部署决定,PAIR 本身不额外收费,也没有按量计费或调用上限。

NVIDIA PAIR 常见问题

PAIR 会聚合多张显卡的显存吗?

不会。PAIR 不池化显存、不切分模型,每个推理请求只分配给一个合格节点并在该节点完成。它带来的是并发调度收益,而非单卡算力放大。

PAIR 支持哪些推理引擎?

首发支持 Ollama 与 LM Studio。PAIR 通过代理它们的本地接口工作,因此现有 Agent 与客户端无需改造即可接入。

至少需要几台设备?

至少两台处于同一局域网的设备即可组成集群;更多设备能进一步提升并发吞吐,但数量并不构成功能门槛。

PAIR 收费吗?

不收费。PAIR 是英伟达发布的免费、开源公测软件,源码托管在 GitHub,使用不产生费用。

支持哪些硬件?

支持 NVIDIA GeForce RTX 20 系及以上显卡、RTX PRO 工作站显卡、DGX Spark,以及 Apple M4 或更新芯片的 Mac;Windows on Arm 支持为实验性。

© 版权声明
AI工具站赚钱操作手册横幅,分享AI工具站SEO、GEO流量增长、CPS、CPA及数字产品变现经验

相关文章