NVIDIA DGX Spark 64GB: 1 ПФЛОП FP4 для локальных ИИ-агентов

NVIDIA добавила в линейку DGX Spark конфигурацию с 64 ГБ памяти. Это настольная система на суперчипе GB10 Grace Blackwell, которую выпускают Acer, ASUS, Dell, Gigabyte, HP и MSI. Смысл новинки простой: запустить открытые модели и постоянно работающих агентов на своём столе, а не на облачном API со счётчиком токенов.

Агенты жгут токены непрерывно — на вызовы инструментов, повторы, длинный контекст и многошаговые планы. По данным NVIDIA, потребление токенов выросло в 14 раз с начала 2026 года. В облаке каждый из них оплачивается, на своём железе тарифа за токен нет.

Что внутри и чем 64 ГБ отличаются от 128 ГБ

Конфигурация сохраняет тот же суперчип GB10, программный стек CUDA и сетевой контроллер ConnectX-7, что и оригинал, но несёт 64 ГБ унифицированной памяти LPDDR5x вместо 128 ГБ. По позиционированию NVIDIA, этого достаточно для самых способных открытых моделей класса 30–35B. Версия на 128 ГБ остаётся в продаже — для задач, которым нужна одна большая машина.

Параметр Значение
Суперчип NVIDIA GB10 Grace Blackwell
CPU 20 ядер Arm (10× Cortex-X925 + 10× Cortex-A725)
ИИ-вычисления до 1 ПФЛОП FP4 (с разрежённостью)
Память 64 ГБ LPDDR5x, когерентная унифицированная
Пропускная способность памяти 273 ГБ/с
Накопитель 1, 2 или 4 ТБ NVMe M.2 с самошифрованием
Сеть ConnectX-7, 200GbE; Wi-Fi 7, BT 5.3
Дисплей 1× HDMI 2.1a
ОС NVIDIA DGX OS (на базе Ubuntu)
Размер и вес 150 × 150 × 50,5 мм / 1,2 кг
Максимальный размер локальной модели до 100 млрд параметров
Доступность 23 октября 2026 года — NVIDIA Marketplace, партнёры-производители, розница

Ключевое решение — унифицированная память. CPU и GPU делят один пул через NVLink-C2C с пропускной способностью в пять раз выше PCIe Gen 5. Копировать веса между системной памятью и видеопамятью не нужно: несколько моделей, их KV-кэши и процессы инструментов живут в одном адресном пространстве.

Софт готов к работе из коробки: DGX OS поставляется со стеком NVIDIA AI, включая PyTorch, Jupyter и Ollama. NVIDIA NemoClaw ставится одной командой и добавляет к агентам OpenClaw контроль приватности и безопасности. NVIDIA OpenShell из состава Agent Toolkit — политики-ограничители сверху. Модели NVIDIA Nemotron оптимизированы под эту машину.

Питается система от обычной розетки — без серверной и специального охлаждения. Для агента, который работает круглосуточно, это существенно.

Какие открытые модели помещаются в 64 ГБ

Железо — половина истории. Вторая половина в том, что открытые модели класса 30B стали достаточно хороши для агентной работы.

Модель Разработчик Тип Объём Роль
Muse Glimmer Meta 29,6B dense, текст + изображения, Apache 2.0 ~17 ГБ (квантованная) Основная агентная модель
Nemotron 3.5 Lightning NVIDIA 30B MoE (30B-A3B) чекпойнт NVFP4 Быстрый исполнитель для долгих агентов
Qwen3.8-27B Alibaba Qwen 27B dense ~13,5 ГБ весов (4 бита) Универсальный агент и код

Оценки даны только по весам — KV-кэш и накладные расходы среды исполнения идут сверху.

Muse Glimmer — основная модель. Meta дистиллировала её из Muse Spark, семейства моделей за ассистентом Meta AI. Она нацелена на локальные агенты: надёжные вызовы инструментов, длинные многошаговые задачи, восстановление после сбоев. Meta заявляет 51,2 на SWE-Bench Pro и 75,5 на MCP Atlas, контекст до 131K токенов. Модель доступна и как NVIDIA NIM.

Полная BF16-версия Glimmer требует 55 ГБ и больше — на контекст почти ничего не остаётся. Практичный выбор на 64 ГБ — квантованная сборка примерно на 17 ГБ.

Крупным моделям вроде DeepSeek V4 Flash одного узла мало: собственные бенчмарки NVIDIA гоняют её на четырёх кластеризованных DGX Spark по 64 ГБ.

Кластеризация: ConnectX-7 и NVIDIA Sync

Каждый DGX Spark несёт ConnectX-7 на 200GbE, и кластеризация — штатная функция, а не надстройка.

Конфигурация Общий объём памяти ИИ-вычисления (FP4) Соединение
1 Spark (64 ГБ) 64 ГБ до 1 ПФЛОП —
2 Spark (по 64 ГБ) 128 ГБ до 2 ПФЛОП прямой кабель QSFP, без коммутатора
2 Spark (по 128 ГБ) 256 ГБ до 2 ПФЛОП прямой кабель QSFP, без коммутатора
3 Spark (по 128 ГБ) 384 ГБ до 3 ПФЛОП кольцо QSFP, без коммутатора
4 Spark (по 128 ГБ) 512 ГБ до 4 ПФЛОП коммутатор 200GbE (QSFP56-DD, RoCE v2)

NVIDIA утверждает, что два кластеризованных блока по 64 ГБ дают до 1,7× производительности одного DGX Spark на 128 ГБ. Причина — удвоенные ИИ-вычисления и пропускная способность: два узла дают до 546 ГБ/с суммарно, вдвое больше одного.

NVIDIA Sync — управляющий слой. Приложение для Windows и macOS находит Spark в сети и управляет доступом по SSH, а Cluster Assistant настраивает сеть ConnectX-7 для систем числом до четырёх. Узлы могут соединяться между площадками через mesh Tailscale — облака в пути данных нет.

Картина складывается такая: кластеризация примерно вдвое сокращает время до первого токена при каждом удвоении и масштабирует дообучение почти линейно. Декодирование улучшается скромнее — около 1,4× на четырёх узлах. Для агентов, читающих длинный ввод, важнее именно выигрыш по времени до первого токена.

Пошаговые руководства для нескольких узлов, включая vLLM на объединённых Spark, лежат на build.nvidia.com/spark.

Что на одной машине реально собрать

  • Постоянный личный агент. Ставим Hermes и направляем на Muse Glimmer или Nemotron 3.5 Lightning, даём инструменты: репозитории на GitHub, прогон тестов, RSS-ленту категорий arXiv. За ночь он разбирает новые issue, воспроизводит падающий тест и готовит черновик pull request. Заодно пересказывает 30 статей, до которых руки не дошли. Личные заметки, код и почта не покидают машину.
  • Дообучение модели под свой репозиторий. QLoRA на модели 70B помещается в 64 ГБ. Обучаем на кодовой базе, внутренней документации и прошлых ревью — получаем локального ассистента, знающего ваши соглашения. NVIDIA измерила около 18 400 токенов/с на одном узле при распределённом дообучении nanochat.
  • Стенд оценки моделей в день выхода. Новая открытая модель появилась на Hugging Face — в тот же день тянем её через Ollama или vLLM и прогоняем свой набор вопросов. Считаем точность, затем время до первого токена (TTFT) и токены в секунду, сравниваем с текущей моделью. Счёт за API при 50 повторных прогонах не приходит.
  • Команда из нескольких моделей. Унифицированная память позволяет делить один пул: Bonsai 2 как маршрутизатор и Glimmer как основной рассуждающий агент — это около 23 ГБ весов, остальное уходит на KV-кэш, ОС и процессы инструментов. Когда задача превышает локальные возможности, агент может отправить очищенный вопрос более крупной облачной модели.
  • Прототипы для периферии и робототехники. Дообучаем vision transformer под конкретную задачу, например поиск аномалий на камере в цеху, проверяем локально на том же стеке CUDA и разворачиваем на устройстве NVIDIA Jetson на периферии.

Чего машина не делает

  • Это не чат-сервер на 100 пользователей. Пропускная способность 273 ГБ/с ограничивает параллельное декодирование.
  • Она заточена под длинный ввод и короткий вывод. Прочитать репозиторий, дамп логов или стопку статей и выдать короткий результат.
  • 64 ГБ ограничивают один узел сотней миллиардов параметров. Больше — либо кластер из двух блоков, либо конфигурация на 128 ГБ.

Для российских команд, которым важно держать данные и код внутри периметра, такая схема — способ обойти и облачные счета, и вопросы о том, где физически лежат промпты. Требования к инфраструктуре минимальны: розетка и сеть, серверная не нужна. Схема с маршрутизатором локального инференса NVIDIA PAIR позволяет развести задачи между RTX, DGX Spark и Mac, а платформа NVIDIA для безопасности агентов добавляет песочницы и карантин — полезно, если агент получает доступ к внутренним системам.

Частые вопросы

Когда DGX Spark 64GB поступит в продажу?

23 октября 2026 года. Каналы — NVIDIA Marketplace, партнёры-производители (Acer, ASUS, Dell, Gigabyte, HP, MSI) и розница.

Версия на 128 ГБ снимается с производства?

Нет. NVIDIA продолжает предлагать DGX Spark 128GB для задач, которым нужна одна большая машина.

Сколько стоит новинка?

В исходных материалах цена не приводится.

Какие модели потянет одна машина?

По позиционированию NVIDIA — открытые модели класса 30–35B, например Muse Glimmer 29,6B, Nemotron 3.5 Lightning 30B и Qwen3.8-27B. Верхняя граница одного узла — 100 млрд параметров.

Muse Glimmer влезет целиком?

Полная BF16-сборка требует 55 ГБ и больше, и на контекст почти ничего не остаётся. На 64 ГБ практична квантованная версия примерно на 17 ГБ.

Можно ли объединить две машины по 64 ГБ?

Да, через ConnectX-7 — получится 128 ГБ общей памяти и до 2 ПФЛОП FP4. По заявлению NVIDIA, это до 1,7× быстрее одного Spark на 128 ГБ.

Нужен ли коммутатор для кластера?

Для двух узлов нет — хватит прямого кабеля QSFP. Коммутатор 200GbE (QSFP56-DD, RoCE v2) нужен только для четырёх узлов.

Что идёт в комплекте с ОС?

DGX OS на базе Ubuntu со стеком NVIDIA AI: PyTorch, Jupyter, Ollama. NVIDIA NemoClaw ставится одной командой, NVIDIA OpenShell даёт политики-ограничители, модели Nemotron оптимизированы под систему.

Подходит ли машина как сервер инференса для отдела?

Нет. Пропускная способность 273 ГБ/с ограничивает параллельное декодирование — это настольная система под длинный ввод и короткий вывод, а не чат-сервер на сотню пользователей.

Источник: marktechpost.com