Мультиагентные рабочие процессы изменили характер локального инференса. Ведущий агент разбивает задачу и порождает субагентов: один пользовательский запрос превращается в десятки независимых вызовов моделей. На одном локальном движке эти вызовы конкурируют за одни и те же слоты выполнения, и очередь растёт, пока рабочая станция, ноутбук или DGX Spark в той же сети простаивают.
NVIDIA Personal AI Router (PAIR) нацелен именно на это узкое место. Это виртуальный маршрутизатор инференса, который обнаруживает совместимые машины в домашней сети и распределяет независимые запросы между ними. Важно: PAIR — не новый движок инференса. Ollama или LM Studio по-прежнему исполняют модель на том узле, который выбрал PAIR.
Что умеет PAIR и как его развернуть
PAIR доступен сегодня как публичная бета (v0.1.1) с подписанными установщиками для Windows, macOS и Linux. Полный исходный код опубликован на GitHub под лицензией Apache 2.0. Маршрутизатор работает полностью в локальной сети, интернет нужен только для загрузки моделей.
Ключевое архитектурное решение — PAIR не вводит собственный кластерный API. Он проксирует интерфейсы, совместимые с Ollama и LM Studio, которые агенты уже используют, занимая порт по умолчанию каждого движка. Если харнесс слушает на другом порту, порт прокси настраивается в параметрах движка PAIR. В репозитории также доступны прокси-эндпоинты, совместимые с OpenAI.
Следствие: существующим агентным харнессам не нужны изменения. Агент решает, какую работу запросить, а PAIR — где она выполнится. Это заметно упрощает развёртывание мультиагентных сценариев — например, тех, что разбирают в курсе по агентному кодингу.
Обнаружение узлов и безопасность
Для автоматического поиска соседних систем PAIR использует mDNS. Если обнаружение не сработало, узел можно добавить по IP-адресу. Доверие устанавливается шестизначным PIN-кодом: он показывается на приглашающей машине и вводится на приглашённой. Весь трафик между узлами заблокирован до завершения сопряжения. После этого связь между парными узлами защищается mTLS с использованием сгенерированных сертификатов.
На каждом узле работает Ollama или LM Studio. PAIR может сам установить движок и запустить загрузку моделей на парных системах, убирая большую часть ручной настройки.
Как планировщик выбирает узел
Узел становится доступным для запроса только при выполнении двух условий: нужный движок включён, и запрошенная модель присутствует на нём точно. Модели не обязаны быть одинаковыми во всём кластере — разные системы могут хранить разные модели, и PAIR маршрутизирует запросы по фактическому расположению модели. Загрузка одного и того же тега на большее число узлов просто расширяет пул доступных кандидатов.
Для каждого запроса планировщик учитывает пять сигналов:
- онлайн ли узел и готов ли он;
- включён ли поддерживаемый движок;
- присутствует ли точная модель;
- текущая загрузка узла и движка заданиями;
- текущая загрузка GPU.
Это конкурентность на уровне рабочих нагрузок, и граница обозначена явно. PAIR назначает каждый запрос одному доступному узлу, где тот выполняется всё время жизни. Маршрутизатор не объединяет VRAM, не сливает GPU в один большой ускоритель и не разбивает один запрос между машинами.
Цифры демонстрации и поддерживаемое железо
В демонстрации NVIDIA PAIR работает вместе с Hermes Desktop, который создаёт нагрузку из пяти субагентов над синтетическим домашним почтовым ящиком. Ollama исполняет Qwen 3.6 35B A3B на каждом выбранном узле.
На одном ноутбуке RTX Spark рабочая нагрузка заняла в среднем 18 минут. На кластере PAIR из трёх устройств — ноутбук RTX Spark, DGX Spark и RTX 5090 — она заняла в среднем 8 минут 48 секунд.
PAIR поддерживает GPU GeForce RTX 20-й серии и новее, рабочие станции RTX PRO начиная с Turing, DGX Spark и Apple M4 или новее. Узлы Windows, Linux и macOS можно сопрягать друг с другом на x64 и arm64, хотя Windows on ARM пока экспериментальна. Валидированные конфигурации требуют 8 ГБ ОЗУ и более, рекомендуется 20 ГБ дискового пространства. Другие дистрибутивы Linux собираются из исходников.
Ограничения бета-версии
Сейчас в PAIR одна политика планирования, и она не учитывает объём VRAM, класс GPU и «прогретость» модели. Это бета-релиз под Apache 2.0, поэтому стоит ожидать изменений в алгоритмах по мере развития проекта. Зато открытый код позволяет следить за развитием — как и в случае с другими открытыми инструментами для ИИ-инференса.
Частые вопросы
Что такое NVIDIA PAIR простыми словами?
Это программа-маршрутизатор для домашней сети. Она видит несколько компьютеров с запущенными Ollama или LM Studio и сама решает, на какой из них отправить каждый запрос от ИИ-агента.
PAIR заменяет Ollama или LM Studio?
Нет. PAIR — не движок инференса. Он только распределяет запросы, а модель исполняет Ollama или LM Studio на выбранном узле.
Нужно ли менять код агентов для работы с PAIR?
Нет. PAIR проксирует интерфейсы Ollama и LM Studio, а также предоставляет OpenAI-совместимые эндпоинты, поэтому агенты продолжают работать без изменений.
Какое железо поддерживает PAIR?
GeForce RTX 20-й серии и новее, RTX PRO начиная с Turing, DGX Spark и Apple M4 или новее. Узлы на Windows, Linux и macOS можно смешивать.
Объединяет ли PAIR видеопамять нескольких GPU?
Нет. PAIR назначает каждый запрос одному узлу и не объединяет VRAM и не разбивает один запрос между машинами.
Насколько безопасно сопряжение узлов?
Сопряжение защищено шестизначным PIN-кодом, а после него весь трафик шифруется mTLS с автоматически сгенерированными сертификатами.
Где взять PAIR?
Это публичная бета v0.1.1 с подписанными установщиками для Windows, macOS и Linux. Исходный код опубликован на GitHub под лицензией Apache 2.0.
Поможет ли PAIR ускорить работу с несколькими ИИ-агентами?
Да, если у вас несколько машин с GPU. В демонстрации NVIDIA нагрузка из пяти субагентов на одном ноутбуке заняла 18 минут, а на кластере из трёх устройств — 8 минут 48 секунд. Похожий подход к распределению нагрузки используют и в других открытых проектах — например, в Shepherd для агентных запусков.
Источник: marktechpost.com