多台本地推理设备共用一个端点
Nvidia 于 9 月 3 日推出 Personal AI Router(PAIR)测试版。The Verge 报道了这次发布,Nvidia 技术文档则说明,PAIR 会连接同一本地网络中的兼容电脑,并向应用提供统一的本地端点。软件在端点之后选择能够处理每个推理请求的设备。
PAIR 目前兼容 Ollama 与 LM Studio 接口。Nvidia 称,支持的系统包括 Windows、macOS 和 Linux,硬件覆盖 GeForce RTX 20 系列及更新 GPU、RTX PRO 工作站、DGX Spark 和 Apple M4 或更新芯片。用户需要在参与设备上安装 PAIR、明确完成配对,并确保请求的模型存在于正在运行的推理引擎中。
路由并不等于合并 GPU
其架构限制非常重要。PAIR 不会合并显存、把多块 GPU 变成一个加速器、切分模型,也不会拆分已经运行的单个请求。每个请求从开始到结束都由一个符合条件的节点处理。更多设备可在任务包含独立请求时提高并发量,但不会自动加速单次推理。
Nvidia 表示,节点通过本地网络相互发现,配对需要用户批准,配对节点之间的流量使用双向 TLS。调度器会考虑可达性、引擎状态、模型是否存在及待处理工作量。Jobs 视图可用于核实请求实际在哪台设备执行。
对本地 AI 的实际意义
PAIR 更适合同时运行多个智能体或本地工具的开发者与高级用户。代理层减少了逐个应用配置的工作,但每个服务节点仍需具备兼容模型、足够内存,并位于可信本地网络。
PAIR 仍是开源测试版,下一步值得关注的问题包括缺陷报告、兼容性更新、安全审查,以及真实工作负载测量,而不是只看厂商演示。