18分钟降至8分48秒,PAIR让三台机器分担推理

2026年09月04日 由 ATYUN编辑部 发表 219 0

办公室里可能同时闲着一台工作站、一台RTX笔记本和一台小型AI主机,多智能体任务却仍排队挤在同一个本地推理端点。NVIDIA发布开源测试版Personal AI Router,也就是PAIR,尝试解决这个错配:Agent继续连接熟悉的Ollama或LM Studio接口,路由器在背后把每个独立请求交给局域网内合适的一台机器。

快速看点:五子代理演示的平均完成时间从18分钟降至8分48秒;PAIR支持Windows、Linux和macOS混合节点;它只做请求级分配,不合并GPU或显存,也不会把一次推理拆到多台机器上。
三台本地计算设备通过网线连接同一实体路由器的原创示意图
原创概念图:PAIR按独立请求选择局域网节点,而不是把多台设备合成一块GPU。

不改Agent接口,改请求落点

PAIR不是新的推理引擎。每台节点仍由Ollama或LM Studio加载模型,PAIR接管兼容代理端点,识别请求需要的引擎和模型,再选择一台合格设备从头到尾执行。应用只看到一个连接,因此已有Agent框架不必先适配一套新集群API。

调度时会检查节点是否在线、引擎是否启用、精确模型是否已经存在、当前作业数量以及GPU利用率。设备可以睡眠、离网或被前台任务占用,再在可用时重新加入。这种弹性更贴近办公室和家庭硬件,而不是假设所有节点始终在线的数据中心。

官方安装包覆盖Windows 11、Debian系Linux和macOS,节点可在x64与arm64之间混合;Windows on Arm仍是实验状态。支持清单包括GeForce RTX 20系列及更新产品、Turing及更新RTX PRO、DGX Spark和Apple M4+。不过模型能否运行,最终仍由引擎、驱动与单机内存决定。

8分48秒来自并发,不是显存魔法

官方演示让Hermes Desktop创建五个子代理,由Ollama运行Qwen 3.6 35B A3B。单台RTX Spark笔记本完成同一任务平均需要18分钟;由RTX Spark笔记本、DGX Spark和RTX 5090组成的三设备环境平均用时8分48秒。收益来自多个独立模型调用可以同时排到不同节点。

这不是“把三张卡拼成一张大卡”。PAIR不会池化显存、不会跨机器切分模型,也不会拆分已经开始的推理请求。高度串行的任务、只有一个长调用的任务,或只有一台机器装有目标模型时,提升可能很小。NVIDIA也明确把结果标为特定配置下的非正式演示,而非通用基准。

本地网络不自动等于安全边界

PAIR可用mDNS发现节点,也能按IP添加设备;六位PIN用于建立信任,配对前节点间通信被阻断,配对后使用mTLS和生成证书。作业与指标页面还能显示每个请求实际落在哪台机器,让调度不再完全不可见。

但“数据留在本地”有前提:客户端、模型来源、推理引擎和所有节点都必须是本地配置。共享办公网络、来路不明的模型、引擎自身的遥测或宽松防火墙都可能扩大边界。企业试点仍要划分专用网段、限制端口、审查模型许可证,并把证书轮换和节点退出纳入运维。

运维还要处理模型分布。节点只有在目标模型和引擎都就绪时才会进入候选池;同一模型复制到更多设备会扩大并发池,却也带来版本、量化方式和磁盘占用的一致性问题。上线前应固定模型摘要与引擎版本,并用作业页面核对请求确实分散执行。

编辑判断:先量队列,再决定要不要组网

PAIR最值得借鉴的不是“家庭集群”概念,而是把Agent并发与推理放置拆开。编排层负责分解任务,路由层负责选择可用节点,引擎负责执行模型。这个边界清楚后,团队能分别观测队列时间、执行时间、输出质量和节点利用率,而不是把所有慢都归因于模型。

当前测试版仍很早。仓库说明调度策略还不考虑GPU型号、可用显存、模型热状态或请求成本,更适合同质或差异不大的节点。Windows on Arm也仍属实验支持。关键生产工作负载不应把它当成成熟调度器。

ATYUN编辑判断:若性能瓶颈来自多个独立请求排队,PAIR提供了低改造成本的验证路径;若瓶颈来自单个模型装不进显存或一次推理本身太慢,它并不能解决。先测真实任务的并行度和队列,再决定是否增加节点,才是这项工具的正确打开方式。

文章来源:AI Agent
欢迎关注ATYUN官方公众号
商务合作及内容投稿请联系邮箱:bd@atyun.com
评论 登录
热门职位
Maluuba
20000~40000/月
Cisco
25000~30000/月 深圳市
PilotAILabs
30000~60000/年 深圳市
写评论取消
回复取消