Qwen3.8-2.4T-A95B: запуск 2.4T-параметрической модели на GB300 NVL72

Alibaba выпустила открытые веса Qwen3.8-2.4T-A95B (Qwen3.8-Max), своей крупнейшей модели с открытым весом. Она приносит возможности, близкие к моделям переднего края, в открытую экосистему. Модель имеет 2.4T общих параметров, из которых при обработке каждого токена активируется 95B. Это делает её одной из самых масштабных открытых моделей для инференса.

Архитектура: MoE, гибридное внимание и контекст до 1M токенов

Qwen3.8-2.4T-A95B построена на архитектуре fine-grained mixture of experts (MoE) с гибридом полного и линейного внимания. Контекстное окно достигает одного миллиона токенов, а максимальная длина выходной последовательности — 128K токенов. Модель рассчитана на сложные рассуждающие и агентные нагрузки.

В слоях полного внимания каждый токен взаимодействует с каждым другим. В слоях линейного внимания растущий KV-кэш заменяется ограниченным рекуррентным состоянием. Это позволяет удерживать вычислительные затраты и использование памяти в пределах разумного при масштабировании контекста до миллиона токенов.

Fine-grained MoE распределяет ёмкость по большему числу меньших экспертов, улучшая специализацию и эффективность маршрутизации. Обучаемый роутер активирует только те эксперты, которые нужны для каждого токена. Затраты на обслуживание зависят от активных параметров, а не от всех 2.4T, что даёт ёмкость уровня frontier-моделей по доле стоимости сопоставимой плотной модели.

Встроенные контролы рассуждения (low/high/xhigh) позволяют разработчикам настраивать глубину инференса для каждого запроса. Можно увеличить вычислительные затраты для сложных многошаговых рассуждений или снизить их для высокопроизводительной обработки документов.

Производительность на GB300 NVL72

GB300 NVL72 — это стоечная архитектура, объединяющая 72 GPU NVIDIA Blackwell Ultra в единую платформу. Домен NVIDIA NVLink на 72 GPU обеспечивает эффективную связь «все со всеми» со скоростью 130 ТБ/с, устраняя узкие места при передаче трафика экспертов через традиционные сети.

Без дополнительной настройки модели на NVIDIA Blackwell GB300 NVL72 в точности FP8 достигается пропускная способность более 4K токенов в секунду на GPU и более 350 токенов в секунду на пользователя. Дальнейшие оптимизации, включая точность NVFP4, ожидаемо дадут дополнительный прирост производительности. Для сравнения: недавно вышедшая модель Muse Glimmer от Meta с 30B параметров помещается в 24 ГБ VRAM — масштаб Qwen3.8-2.4T-A95B требует уже кластерного уровня вычислений.

Пост-обучение и варианты развертывания

NVIDIA поддерживает несколько стеков инференса: SGLang, vLLM и NVIDIA Dynamo предоставляют открытые рецепты для разработчиков, которым нужен больший контроль над производительностью. Также модель доступна через model-free NVIDIA NIM — единый контейнер инференса, который обслуживает любую поддерживаемую модель. Веса можно загрузить и развернуть в первый же день, обслуживая тонко настроенные чекпоинты и масштабируясь до продакшена.

Для пост-обучения под доменные задачи используется NVIDIA NeMo AutoModel — PyTorch-нативная библиотека тонкой настройки с поддержкой чекпоинтов Hugging Face с первого дня. Можно обучать напрямую на существующих чекпоинтах без конвертации, с поддержкой полного SFT или эффективного по памяти LoRA. Это особенно актуально для агентных сценариев: как и в случае со специализированной моделью Fugu-Cyber от Sakana AI, дообучение открытой модели под узкую задачу может дать результат, недостижимый для универсальных систем.

Начало работы

Веса Qwen3.8-2.4T-A95B доступны для загрузки с Hugging Face или ModelScope. Развернуть модель можно с помощью model-free NVIDIA NIM из NVIDIA NGC. Если вы только начинаете знакомство с агентными моделями, обратите внимание на Pokee-Isaac 28B — более лёгкую альтернативу с контекстом 10M токенов для работы внутри периметра.

Частые вопросы

Что такое Qwen3.8-2.4T-A95B?

Это крупнейшая открытая модель Alibaba с 2.4T общих параметров, из которых при обработке токена активируется 95B. Архитектура — fine-grained MoE с гибридным вниманием, контекст до 1M токенов.

Какое оборудование нужно для запуска?

Для инференса в продакшене требуется кластер уровня дата-центра. NVIDIA рекомендует GB300 NVL72, но модель можно развернуть и на других конфигурациях с поддержкой соответствующих библиотек.

Чем гибридное внимание лучше обычного?

Полное внимание обеспечивает максимальную точность, а линейное заменяет растущий KV-кэш ограниченным рекуррентным состоянием. Это позволяет удерживать затраты памяти и вычислений при контексте до миллиона токенов.

Как управлять глубиной рассуждений?

Встроенные контролы low/high/xhigh позволяют переключать глубину инференса на уровне запроса. Это даёт гибкость между качеством рассуждений и пропускной способностью.

Какие стеки инференса поддерживаются?

NVIDIA поддерживает SGLang, vLLM и NVIDIA Dynamo, а также model-free NIM для универсального развертывания.

Как дообучить модель под свои задачи?

Используйте NVIDIA NeMo AutoModel с поддержкой полного SFT или LoRA. Чекпоинты Hugging Face поддерживаются с первого дня без конвертации.

Где скачать веса?

Веса доступны на Hugging Face и ModelScope, а контейнер NIM — в NVIDIA NGC.

Подходит ли модель для агентных нагрузок?

Да, модель спроектирована для сложных агентных сценариев: кодинга, анализа больших документов и многошаговых рабочих процессов с накоплением контекста.

Источник: developer.nvidia.com