Alibaba выпустила открытые веса Qwen3.8-2.4T-A95B (Qwen3.8-Max), своей крупнейшей модели с открытым весом. Она приносит возможности, близкие к моделям переднего края, в открытую экосистему. Модель имеет 2.4T общих параметров, из которых при обработке каждого токена активируется 95B. Это делает её одной из самых масштабных открытых моделей для инференса.
Архитектура: MoE, гибридное внимание и контекст до 1M токенов
Qwen3.8-2.4T-A95B построена на архитектуре fine-grained mixture of experts (MoE) с гибридом полного и линейного внимания. Контекстное окно достигает одного миллиона токенов, а максимальная длина выходной последовательности — 128K токенов. Модель рассчитана на сложные рассуждающие и агентные нагрузки.
В слоях полного внимания каждый токен взаимодействует с каждым другим. В слоях линейного внимания растущий KV-кэш заменяется ограниченным рекуррентным состоянием. Это позволяет удерживать вычислительные затраты и использование памяти в пределах разумного при масштабировании контекста до миллиона токенов.
Fine-grained MoE распределяет ёмкость по большему числу меньших экспертов, улучшая специализацию и эффективность маршрутизации. Обучаемый роутер активирует только те эксперты, которые нужны для каждого токена. Затраты на обслуживание зависят от активных параметров, а не от всех 2.4T, что даёт ёмкость уровня frontier-моделей по доле стоимости сопоставимой плотной модели.
Встроенные контролы рассуждения (low/high/xhigh) позволяют разработчикам настраивать глубину инференса для каждого запроса. Можно увеличить вычислительные затраты для сложных многошаговых рассуждений или снизить их для высокопроизводительной обработки документов.
Производительность на GB300 NVL72
GB300 NVL72 — это стоечная архитектура, объединяющая 72 GPU NVIDIA Blackwell Ultra в единую платформу. Домен NVIDIA NVLink на 72 GPU обеспечивает эффективную связь «все со всеми» со скоростью 130 ТБ/с, устраняя узкие места при передаче трафика экспертов через традиционные сети.
Без дополнительной настройки модели на NVIDIA Blackwell GB300 NVL72 в точности FP8 достигается пропускная способность более 4K токенов в секунду на GPU и более 350 токенов в секунду на пользователя. Дальнейшие оптимизации, включая точность NVFP4, ожидаемо дадут дополнительный прирост производительности. Для сравнения: недавно вышедшая модель Muse Glimmer от Meta с 30B параметров помещается в 24 ГБ VRAM — масштаб Qwen3.8-2.4T-A95B требует уже кластерного уровня вычислений.
Пост-обучение и варианты развертывания
NVIDIA поддерживает несколько стеков инференса: SGLang, vLLM и NVIDIA Dynamo предоставляют открытые рецепты для разработчиков, которым нужен больший контроль над производительностью. Также модель доступна через model-free NVIDIA NIM — единый контейнер инференса, который обслуживает любую поддерживаемую модель. Веса можно загрузить и развернуть в первый же день, обслуживая тонко настроенные чекпоинты и масштабируясь до продакшена.
Для пост-обучения под доменные задачи используется NVIDIA NeMo AutoModel — PyTorch-нативная библиотека тонкой настройки с поддержкой чекпоинтов Hugging Face с первого дня. Можно обучать напрямую на существующих чекпоинтах без конвертации, с поддержкой полного SFT или эффективного по памяти LoRA. Это особенно актуально для агентных сценариев: как и в случае со специализированной моделью Fugu-Cyber от Sakana AI, дообучение открытой модели под узкую задачу может дать результат, недостижимый для универсальных систем.
Начало работы
Веса Qwen3.8-2.4T-A95B доступны для загрузки с Hugging Face или ModelScope. Развернуть модель можно с помощью model-free NVIDIA NIM из NVIDIA NGC. Если вы только начинаете знакомство с агентными моделями, обратите внимание на Pokee-Isaac 28B — более лёгкую альтернативу с контекстом 10M токенов для работы внутри периметра.
Частые вопросы
Что такое Qwen3.8-2.4T-A95B?
Это крупнейшая открытая модель Alibaba с 2.4T общих параметров, из которых при обработке токена активируется 95B. Архитектура — fine-grained MoE с гибридным вниманием, контекст до 1M токенов.
Какое оборудование нужно для запуска?
Для инференса в продакшене требуется кластер уровня дата-центра. NVIDIA рекомендует GB300 NVL72, но модель можно развернуть и на других конфигурациях с поддержкой соответствующих библиотек.
Чем гибридное внимание лучше обычного?
Полное внимание обеспечивает максимальную точность, а линейное заменяет растущий KV-кэш ограниченным рекуррентным состоянием. Это позволяет удерживать затраты памяти и вычислений при контексте до миллиона токенов.
Как управлять глубиной рассуждений?
Встроенные контролы low/high/xhigh позволяют переключать глубину инференса на уровне запроса. Это даёт гибкость между качеством рассуждений и пропускной способностью.
Какие стеки инференса поддерживаются?
NVIDIA поддерживает SGLang, vLLM и NVIDIA Dynamo, а также model-free NIM для универсального развертывания.
Как дообучить модель под свои задачи?
Используйте NVIDIA NeMo AutoModel с поддержкой полного SFT или LoRA. Чекпоинты Hugging Face поддерживаются с первого дня без конвертации.
Где скачать веса?
Веса доступны на Hugging Face и ModelScope, а контейнер NIM — в NVIDIA NGC.
Подходит ли модель для агентных нагрузок?
Да, модель спроектирована для сложных агентных сценариев: кодинга, анализа больших документов и многошаговых рабочих процессов с накоплением контекста.
Источник: developer.nvidia.com