Perplexity Portable Computer на NVIDIA DGX Spark: локальный агент с облачной эскалацией по одобрению

Perplexity выпустила Portable Computer — локальную сборку своей агентной платформы Computer, которая работает на NVIDIA DGX Spark. Агентский харнесс, оркестратор, планировщик, маршрутизатор инструментов и дообученные модели выполняются прямо на устройстве, а не в облаке. Каждая задача начинается на устройстве, и шаги, обработанные локальными моделями, не тарифицируются пословно. Когда шагу нужен живой веб или рассуждения фронтальной модели, оркестратор останавливается и спрашивает разрешения перед отправкой этого единственного шага в одну из более чем 15 облачных моделей.

Что именно устанавливается на устройство

Portable Computer — это не локальный чат-приложение с выбором файлов. Perplexity упаковывает локальную модель, инференс-движок, агентский харнесс, песочницу инструментов и коннекторы приложений как единую систему, что снимает обычную работу по поднятию инференс-сервера и ручной настройке инструментов.

Пользователи выбирают одну из двух моделей: Qwen 3.8 27B или PPLX 27B — дообученный Perplexity вариант, настроенный под собственный харнесс. NVIDIA Nemotron 3.5 Lightning, открытая модель 30B MoE, указана как «скоро». Поддерживается и собственная модель с собственным инференс-сервером.

Код и вызовы инструментов выполняются внутри песочницы, ограниченной на уровне ОС: она ограничивает процессы, пути файловой системы и сетевой доступ. Если песочница недоступна, выполнение инструментов отключается, а не незаметно деградирует. Коннекторы Gmail, Outlook, Slack и GitHub маршрутизируются через локальный оркестратор.

Гейт эскалации — ключевое архитектурное решение

Локальность не означает офлайн. Когда шагу нужен живой веб или фронтальные рассуждения, оркестратор останавливается и спрашивает. Перед любым вызовом харнесс отбирает релевантный контекст, прогоняет его через PII-классификатор и показывает пользователю, что именно покинет машину. Одобренный шаг уходит в одну из более чем 15 облачных моделей; удалённый советник возвращает текстовые рекомендации и никогда не получает прямого доступа к локальным файлам, инструментам или диалогу.

Perplexity также обошла ограничения контекста малых моделей. Qwen 3.8 27B заявляет окно 260K токенов, но деградирует после примерно 100K, поэтому харнесс держит системный промпт и набор инструментов компактными, подгружает специализированные навыки по требованию, предоставляет коннекторы как компактные CLI-инструменты вместо полных MCP-определений и уплотняет устаревший контекст в процессе работы.

Бенчмарки и результаты

На собственном бенчмарке Local Knowledge Work Bench (53 задачи: глубокие исследования, финансовый анализ, создание документов; Perplexity планирует открыть его исходный код) Computer с Qwen 3.8 27B на DGX Spark набрал 82,6% против 77,6% у открытого харнесса Pi и 74,0% у Hermes на той же модели. PPLX 27B поднял результат до 85,4%.

На BrowseComp Computer показал 66,7% против 50,2% (Pi) и 43,9% (Hermes), используя на 51% меньше времени и на 70% меньше токенов, чем Pi. На ParseBench-100 для визуального понимания документов — 65,1% против 34,6% и 13,9%.

Самый показательный результат — гибридный. На Terminal Bench 2.1 полностью локальный прогон набрал 59,6% при практически нулевой предельной стоимости; эскалация к советнику подняла результат до 73,0% при примерно $0,415 за прогон, тогда как один Claude Opus 5 показывает 82,4% при примерно $0,65. Эскалация сокращает разрыв с фронтальными моделями, но не закрывает его.

Железо, цены и ограничения

Для установки на DGX Spark нужен суперчип GB10, 128 ГБ памяти и минимум 1 ТБ хранилища. Оркестратор Qwen 3.8 27B поставляется в 3-битном квантовании, загрузка 17,4 ГБ, требуется 32 ГБ RAM; Nemotron 3.5 Lightning — 4-битный, 19 ГБ, требуется 36 ГБ. Другие системы требуют DGX OS или Ubuntu на ARM или x64 с RTX GPU от 24 ГБ VRAM. Установка — стандартное добавление apt-репозитория.

Доступность — сначала Linux для подписчиков Pro, Max, Enterprise Pro и Enterprise Max; Windows — в сентябре, macOS в дорожной карте нет. На запуске поддерживается только один DGX Spark; кластеризация — в планах, а не в поставке. Работа локальных моделей не тарифицируется пословно, что делает миграции в масштабе репозитория и длинные циклы проверки экономически разумными на собственном железе.

Это рабочее ПО, а не превью-бинарь, но нужен бокс класса GB10 или RTX GPU с 24 ГБ VRAM. Целевая аудитория — предприятия и команды среднего размера, уже владеющие NVIDIA-рабочими станциями, плюс хорошо финансируемые AI-стартапы. Для обычного SMB вариант нежизнеспособен: машина — цена входа. Отрасли: финансы, юриспруденция, здравоохранение, госсектор, оборона и инженерия с тяжёлым IP — везде, где резиденция данных или договорная конфиденциальность блокируют облачный инференс.

Частые вопросы

Кому нужен Portable Computer?

Предприятиям и командам, у которых уже есть NVIDIA-рабочие станции, и AI-стартапам. Обычному малому бизнесу вариант не подходит: стоимость машины — цена входа.

Какие модели доступны локально?

Qwen 3.8 27B или PPLX 27B (дообученная Perplexity), скоро добавится NVIDIA Nemotron 3.5 Lightning. Можно подключить и собственную модель.

Как работает эскалация в облако?

Оркестратор останавливается, прогоняет контекст через PII-классификатор, показывает, что покинет машину, и ждёт одобрения. Облачная модель получает только текст и не имеет доступа к локальным файлам.

Сколько стоит облачный шаг?

Локальные шаги бесплатны. Эскалация на Terminal Bench 2.1 стоила примерно $0,415 за прогон против $0,65 у Claude Opus 5.

Какое железо нужно?

DGX Spark с GB10, 128 ГБ RAM и 1 ТБ хранилища, либо RTX GPU с 24 ГБ VRAM на DGX OS или Ubuntu. Для Qwen нужно 32 ГБ RAM, для Nemotron — 36 ГБ.

Насколько безопасна локальная песочница?

Она ограничена на уровне ОС: процессы, пути и сеть. Если песочница недоступна, инструменты отключаются полностью, без тихой деградации.

Когда выйдет версия для Windows?

В сентябре. macOS в дорожной карте нет, кластеризация DGX Spark тоже пока не поддерживается.

Это лучше, чем облачный Computer?

На бенчмарках локальная версия уступает фронтальным моделям, но эскалация сокращает разрыв. Главный выигрыш — данные не покидают машину без явного одобрения.

Perplexity также выпустила обновление для ИИ-агентов с фокусом на локальную работу, а NVIDIA показала архитектуру агента, которая решает задачи без переобучения модели. Вопросы безопасности агентов разобраны в материале NVIDIA AI Red Team.

Источник: marktechpost.com