NVIDIA 公布免費工具 PAIR(Personal AI Router),可偵測同一網絡內的相容電腦,自動將 AI 推理工作分配至多部裝置處理,藉此加快多代理人工作流程。工具相容於 Ollama 及 LM Studio 等本機 AI 執行環境,用戶無需修改現有程式碼即可直接使用。
PAIR 解決多代理人瓶頸
AI 代理人可將複雜任務拆分為多個較小工作,再分配給專門的子代理人負責。近期用戶同時執行多個 AI 代理人的情況愈趨普遍,多代理人工作流程雖然能縮短完成任務的時間並提升回應質素,但大量請求同時傳送至 GPU,容易造成系統瓶頸。PAIR 的目標正是減輕這個瓶頸。

Ollama 與 LM Studio 一般只會在用戶選定的單一裝置執行模型,PAIR 則會偵測網絡內其他參與裝置,符合條件時便將工作分配過去,並在收到回應後傳回發出請求的來源。運作時,PAIR 透過代理伺服器接收請求,識別所需引擎與模型條件後選擇合適節點,節點執行請求後再將結果回傳給 PAIR。AI 代理人一方無需自行選擇節點,只需送出請求,其餘工作全由 PAIR 處理。
PAIR 的代理伺服器相容於 Ollama 及 LM Studio,因此不需要新增 API。閒置時,PAIR 亦會自動將不需要的節點關機或轉入休眠狀態,減省耗電。
根據 NVIDIA 官方技術網誌,PAIR 採用 mDNS 技術在本機網絡自動搜尋裝置,配對過程需輸入 6 位數 PIN 碼以建立信任連線,確保只有獲授權裝置可加入叢集。節點之間傳輸的推理流量另外採用雙向 TLS(mTLS)加密驗證雙方身份,NVIDIA 強調提示內容、檔案及代理人上下文均保留在用戶本機網絡內,不會傳送至雲端推理服務。
實測時間大幅縮短
NVIDIA 使用 AI 代理人管理工具 Hermes Desktop 配合 Ollama 及 PAIR,執行 5 個子代理人的示範。測試採用阿里巴巴開放模型 Qwen 3.6-35B-A3B,量度 5 個子代理人工作負載完成所需時間。將 RTX Spark 電腦、DGX Spark 工作站及 RTX 5090 電腦 3 部裝置透過 PAIR 組成叢集處理,平均需 8 分 48 秒完成;若只用單一 RTX Spark 電腦處理,平均則需 18 分鐘,顯示叢集處理可大幅縮短運算時間。

系統要求與裝置相容
PAIR 支援作業系統包括 Windows 11、DGX OS、Ubuntu 14.04 及 macOS Tahoe。顯示卡方面,需要 GeForce RTX 20 系列或以上型號,亦支援 RTX PRO 工作站顯示卡(Turing 架構或以上)、DGX Spark 及 DGX Spark GB10,或 Mac M4 或以上晶片裝置。記憶體要求最低 8 GB,儲存空間需預留最少 20 GB。網絡連線僅用於下載模型,實際運算過程不需要連接互聯網。
NVIDIA 官方指出,PAIR 屬開放原始碼工具,目前處於公開測試階段,將持續擴大支援裝置範圍。
