NVIDIA добавила в линейку DGX Spark конфигурацию с 64 ГБ памяти. Это настольная система на суперчипе GB10 Grace Blackwell, которую выпускают Acer, ASUS, Dell, Gigabyte, HP и MSI. Смысл новинки простой: запустить открытые модели и постоянно работающих агентов на своём столе, а не на облачном API со счётчиком токенов.
Агенты жгут токены непрерывно — на вызовы инструментов, повторы, длинный контекст и многошаговые планы. По данным NVIDIA, потребление токенов выросло в 14 раз с начала 2026 года. В облаке каждый из них оплачивается, на своём железе тарифа за токен нет.
Что внутри и чем 64 ГБ отличаются от 128 ГБ
Конфигурация сохраняет тот же суперчип GB10, программный стек CUDA и сетевой контроллер ConnectX-7, что и оригинал, но несёт 64 ГБ унифицированной памяти LPDDR5x вместо 128 ГБ. По позиционированию NVIDIA, этого достаточно для самых способных открытых моделей класса 30–35B. Версия на 128 ГБ остаётся в продаже — для задач, которым нужна одна большая машина.
| Параметр | Значение |
|---|---|
| Суперчип | NVIDIA GB10 Grace Blackwell |
| CPU | 20 ядер Arm (10× Cortex-X925 + 10× Cortex-A725) |
| ИИ-вычисления | до 1 ПФЛОП FP4 (с разрежённостью) |
| Память | 64 ГБ LPDDR5x, когерентная унифицированная |
| Пропускная способность памяти | 273 ГБ/с |
| Накопитель | 1, 2 или 4 ТБ NVMe M.2 с самошифрованием |
| Сеть | ConnectX-7, 200GbE; Wi-Fi 7, BT 5.3 |
| Дисплей | 1× HDMI 2.1a |
| ОС | NVIDIA DGX OS (на базе Ubuntu) |
| Размер и вес | 150 × 150 × 50,5 мм / 1,2 кг |
| Максимальный размер локальной модели | до 100 млрд параметров |
| Доступность | 23 октября 2026 года — NVIDIA Marketplace, партнёры-производители, розница |
Ключевое решение — унифицированная память. CPU и GPU делят один пул через NVLink-C2C с пропускной способностью в пять раз выше PCIe Gen 5. Копировать веса между системной памятью и видеопамятью не нужно: несколько моделей, их KV-кэши и процессы инструментов живут в одном адресном пространстве.
Софт готов к работе из коробки: DGX OS поставляется со стеком NVIDIA AI, включая PyTorch, Jupyter и Ollama. NVIDIA NemoClaw ставится одной командой и добавляет к агентам OpenClaw контроль приватности и безопасности. NVIDIA OpenShell из состава Agent Toolkit — политики-ограничители сверху. Модели NVIDIA Nemotron оптимизированы под эту машину.
Питается система от обычной розетки — без серверной и специального охлаждения. Для агента, который работает круглосуточно, это существенно.
Какие открытые модели помещаются в 64 ГБ
Железо — половина истории. Вторая половина в том, что открытые модели класса 30B стали достаточно хороши для агентной работы.
| Модель | Разработчик | Тип | Объём | Роль |
|---|---|---|---|---|
| Muse Glimmer | Meta | 29,6B dense, текст + изображения, Apache 2.0 | ~17 ГБ (квантованная) | Основная агентная модель |
| Nemotron 3.5 Lightning | NVIDIA | 30B MoE (30B-A3B) | чекпойнт NVFP4 | Быстрый исполнитель для долгих агентов |
| Qwen3.8-27B | Alibaba Qwen | 27B dense | ~13,5 ГБ весов (4 бита) | Универсальный агент и код |
Оценки даны только по весам — KV-кэш и накладные расходы среды исполнения идут сверху.
Muse Glimmer — основная модель. Meta дистиллировала её из Muse Spark, семейства моделей за ассистентом Meta AI. Она нацелена на локальные агенты: надёжные вызовы инструментов, длинные многошаговые задачи, восстановление после сбоев. Meta заявляет 51,2 на SWE-Bench Pro и 75,5 на MCP Atlas, контекст до 131K токенов. Модель доступна и как NVIDIA NIM.
Полная BF16-версия Glimmer требует 55 ГБ и больше — на контекст почти ничего не остаётся. Практичный выбор на 64 ГБ — квантованная сборка примерно на 17 ГБ.
Крупным моделям вроде DeepSeek V4 Flash одного узла мало: собственные бенчмарки NVIDIA гоняют её на четырёх кластеризованных DGX Spark по 64 ГБ.
Кластеризация: ConnectX-7 и NVIDIA Sync
Каждый DGX Spark несёт ConnectX-7 на 200GbE, и кластеризация — штатная функция, а не надстройка.
| Конфигурация | Общий объём памяти | ИИ-вычисления (FP4) | Соединение |
|---|---|---|---|
| 1 Spark (64 ГБ) | 64 ГБ | до 1 ПФЛОП | — |
| 2 Spark (по 64 ГБ) | 128 ГБ | до 2 ПФЛОП | прямой кабель QSFP, без коммутатора |
| 2 Spark (по 128 ГБ) | 256 ГБ | до 2 ПФЛОП | прямой кабель QSFP, без коммутатора |
| 3 Spark (по 128 ГБ) | 384 ГБ | до 3 ПФЛОП | кольцо QSFP, без коммутатора |
| 4 Spark (по 128 ГБ) | 512 ГБ | до 4 ПФЛОП | коммутатор 200GbE (QSFP56-DD, RoCE v2) |
NVIDIA утверждает, что два кластеризованных блока по 64 ГБ дают до 1,7× производительности одного DGX Spark на 128 ГБ. Причина — удвоенные ИИ-вычисления и пропускная способность: два узла дают до 546 ГБ/с суммарно, вдвое больше одного.
NVIDIA Sync — управляющий слой. Приложение для Windows и macOS находит Spark в сети и управляет доступом по SSH, а Cluster Assistant настраивает сеть ConnectX-7 для систем числом до четырёх. Узлы могут соединяться между площадками через mesh Tailscale — облака в пути данных нет.
Картина складывается такая: кластеризация примерно вдвое сокращает время до первого токена при каждом удвоении и масштабирует дообучение почти линейно. Декодирование улучшается скромнее — около 1,4× на четырёх узлах. Для агентов, читающих длинный ввод, важнее именно выигрыш по времени до первого токена.
Пошаговые руководства для нескольких узлов, включая vLLM на объединённых Spark, лежат на build.nvidia.com/spark.
Что на одной машине реально собрать
- Постоянный личный агент. Ставим Hermes и направляем на Muse Glimmer или Nemotron 3.5 Lightning, даём инструменты: репозитории на GitHub, прогон тестов, RSS-ленту категорий arXiv. За ночь он разбирает новые issue, воспроизводит падающий тест и готовит черновик pull request. Заодно пересказывает 30 статей, до которых руки не дошли. Личные заметки, код и почта не покидают машину.
- Дообучение модели под свой репозиторий. QLoRA на модели 70B помещается в 64 ГБ. Обучаем на кодовой базе, внутренней документации и прошлых ревью — получаем локального ассистента, знающего ваши соглашения. NVIDIA измерила около 18 400 токенов/с на одном узле при распределённом дообучении nanochat.
- Стенд оценки моделей в день выхода. Новая открытая модель появилась на Hugging Face — в тот же день тянем её через Ollama или vLLM и прогоняем свой набор вопросов. Считаем точность, затем время до первого токена (TTFT) и токены в секунду, сравниваем с текущей моделью. Счёт за API при 50 повторных прогонах не приходит.
- Команда из нескольких моделей. Унифицированная память позволяет делить один пул: Bonsai 2 как маршрутизатор и Glimmer как основной рассуждающий агент — это около 23 ГБ весов, остальное уходит на KV-кэш, ОС и процессы инструментов. Когда задача превышает локальные возможности, агент может отправить очищенный вопрос более крупной облачной модели.
- Прототипы для периферии и робототехники. Дообучаем vision transformer под конкретную задачу, например поиск аномалий на камере в цеху, проверяем локально на том же стеке CUDA и разворачиваем на устройстве NVIDIA Jetson на периферии.
Чего машина не делает
- Это не чат-сервер на 100 пользователей. Пропускная способность 273 ГБ/с ограничивает параллельное декодирование.
- Она заточена под длинный ввод и короткий вывод. Прочитать репозиторий, дамп логов или стопку статей и выдать короткий результат.
- 64 ГБ ограничивают один узел сотней миллиардов параметров. Больше — либо кластер из двух блоков, либо конфигурация на 128 ГБ.
Для российских команд, которым важно держать данные и код внутри периметра, такая схема — способ обойти и облачные счета, и вопросы о том, где физически лежат промпты. Требования к инфраструктуре минимальны: розетка и сеть, серверная не нужна. Схема с маршрутизатором локального инференса NVIDIA PAIR позволяет развести задачи между RTX, DGX Spark и Mac, а платформа NVIDIA для безопасности агентов добавляет песочницы и карантин — полезно, если агент получает доступ к внутренним системам.
Частые вопросы
Когда DGX Spark 64GB поступит в продажу?
23 октября 2026 года. Каналы — NVIDIA Marketplace, партнёры-производители (Acer, ASUS, Dell, Gigabyte, HP, MSI) и розница.
Версия на 128 ГБ снимается с производства?
Нет. NVIDIA продолжает предлагать DGX Spark 128GB для задач, которым нужна одна большая машина.
Сколько стоит новинка?
В исходных материалах цена не приводится.
Какие модели потянет одна машина?
По позиционированию NVIDIA — открытые модели класса 30–35B, например Muse Glimmer 29,6B, Nemotron 3.5 Lightning 30B и Qwen3.8-27B. Верхняя граница одного узла — 100 млрд параметров.
Muse Glimmer влезет целиком?
Полная BF16-сборка требует 55 ГБ и больше, и на контекст почти ничего не остаётся. На 64 ГБ практична квантованная версия примерно на 17 ГБ.
Можно ли объединить две машины по 64 ГБ?
Да, через ConnectX-7 — получится 128 ГБ общей памяти и до 2 ПФЛОП FP4. По заявлению NVIDIA, это до 1,7× быстрее одного Spark на 128 ГБ.
Нужен ли коммутатор для кластера?
Для двух узлов нет — хватит прямого кабеля QSFP. Коммутатор 200GbE (QSFP56-DD, RoCE v2) нужен только для четырёх узлов.
Что идёт в комплекте с ОС?
DGX OS на базе Ubuntu со стеком NVIDIA AI: PyTorch, Jupyter, Ollama. NVIDIA NemoClaw ставится одной командой, NVIDIA OpenShell даёт политики-ограничители, модели Nemotron оптимизированы под систему.
Подходит ли машина как сервер инференса для отдела?
Нет. Пропускная способность 273 ГБ/с ограничивает параллельное декодирование — это настольная система под длинный ввод и короткий вывод, а не чат-сервер на сотню пользователей.
Источник: marktechpost.com