Dense против MoE: активные параметры, пропускная способность и что выбрать

Модель на 30 млрд параметров может активировать лишь 3 млрд на каждый токен — и при этом использовать ёмкость всей сети. Именно так устроена Nemotron 3.5 Lightning: архитектура Mixture-of-Experts (MoE) выбирает для каждого токена лишь часть параметров. Как организованы параметры модели, часто важнее их количества: выбор между dense и MoE сильнее влияет на пропускную способность, расход памяти и сложность обслуживания, чем сырое число параметров.

Разница похожа на два двигателя одинакового объёма: один сжигает топливо во всех цилиндрах каждый такт, второй подключает только нужные.

Как устроены dense- и MoE-модели

В dense-модели каждый параметр участвует в каждом прямом проходе. Все 27 млрд параметров модели на 27 млрд срабатывают для каждого токена через один общий блок feed-forward network (FFN) в каждом слое декодера.

MoE-модель заменяет этот единый FFN несколькими FFN-блоками — экспертами. Внутренний механизм маршрутизации пропускает входящие токены через небольшую часть экспертов, а не через все параметры. Структурно: там, где у dense-модели в слое декодера один FFN, у MoE-слоя их несколько (например, 8, 64 или 128). Перед ними стоит обученная gate-сеть, обычно называемая сетью-роутером (router network): она назначает каждый токен top-k экспертам с наивысшим скором. Выбранные FFN-блоки и выполняются для этого токена, остальные в данном слое пропускаются. Большинство современных MoE, включая Mistral Small 4, дополнительно прогоняют один «общий» эксперт, куда токен попадает всегда.

Как работает маршрутизация в MoE

Решение о маршрутизации принимается отдельно для каждого слоя: токен не закрепляется за экспертом до конца вычислений. На каждом слое декодера он перенаправляется заново, исходя из того, что представляет собой на этом этапе сети. Эксперты здесь — не специалисты по предметным областям в привычном смысле: их специализация лежит в первую очередь в синтаксисе и типах токенов (пунктуация, числа и т. п.), хотя это зависит от архитектуры и методов обучения.

Пока роутер решает, какие FFN-блоки пропустить на каждом слое, токены всё равно проходят через полный механизм внимания. Когда карточка модели говорит «3 млрд активных параметров», туда входят и веса внимания, и веса эмбеддингов для каждого токена, а также веса выбранных FFN.

У MoE есть варианты. Так, карточка NVIDIA для Nemotron 3.5 Lightning описывает гибрид Mamba-2 + MoE + Attention. Слои Mamba-2 заменяют внимание в большинстве слоёв и несут рекуррентное состояние постоянного размера вместо растущего KV-кэша. Это меняет профиль памяти на длинном контексте так, как одна разреженность не объясняет. Lightning к тому же сжимает пространство решений перед маршрутизацией, чтобы решение давалось модели дешевле. Отметим: MoE — это разновидность разреженной (sparse) модели.

Что быстрее: dense или MoE

MoE обычно быстрее по пропускной способности в токенах: на каждый токен активируется лишь часть feed-forward параметров. Dense-модели задействуют всю сеть, зато дают более простое обслуживание и предсказуемую задержку.

При высокой конкурентности маршрутизация и перемещение данных сужают преимущество MoE. Результат зависит от железа, точности, фреймворка инференса и дизайна модели. Например, у Nemotron 3.5 Lightning есть слои Mamba-2 и speculative decoding.

Ключевое различие — в двух вещах. Во-первых, при равном общем числе параметров пропущенные FFN-блоки делают MoE быстрее. Во-вторых, MoE развязывает память (общее число параметров → VRAM) и вычисления (активные параметры → FLOPs на токен). В dense-модели расходы на хостинг и инференс растут вместе, а MoE эту связь разрывает: VRAM платится заранее, а вычисления — за токен и масштабируются только по сработавшим экспертам. Простаивающие эксперты не стоят вычислений, но память под них всё равно выделена — в этом и главный компромисс: переменные вычисления на токен против фиксированной памяти.

При размере батча 1 декодирование ограничено доступной памятью, а не вычислениями, — и здесь MoE показывает себя хорошо, читая меньше байтов весов на токен. С ростом батча токены коллективно задействуют большинство экспертов, и преимущество сужается, хотя сокращение работы на токен сохраняется. MoE удерживает преимущество по пропускной способности на всех размерах батча, но отрыв по задержке от хорошо оптимизированной dense-модели сжимается при высокой конкурентности.

Современные фреймворки инференса обычно обрабатывают маршрутизацию без отбрасывания токенов, но все эксперты должны одновременно находиться в памяти GPU. Это оставляет меньше места под KV-кэш, чем у dense-модели сопоставимого размера.

Сравнение на примере

При равном общем размере разреженность прямо видна в пропускной способности. Gemma 4 31B и Nemotron 3.5 Lightning — обе примерно на 30 млрд параметров, но диапазоны их выходной скорости у провайдеров GPU не пересекаются. Активация 3 млрд параметров на токен — важная причина, хотя не единственная: слои Mamba-2 и speculative decoding в Lightning дают вклад независимо от гибридной MoE-архитектуры.

Модель Архитектура Всего параметров Активных VRAM (нативная) VRAM (4-bit) Output speed $/M output
Gemma 4 31B Dense; мультимодальная 31B 31B ~61 ГБ BF16 (1×H100) ~16 ГБ 36.9–222.4 t/s $0.40
Qwen3.8-27B Dense; гибрид linear/full attention; MTP head; мультимодальная 27B 27B ~56 ГБ BF16 (1×H100) ~14 ГБ 46.8 t/s $3.00
Nemotron 3.5 Lightning MoE + Mamba-2 attention hybrid 30B 3B ~60 ГБ BF16 (1×H100) ~20 ГБ 235.7–494.2 t/s $0.22
Mistral Small 4 MoE; мультимодальная 119B 6B (8B с эмбеддингами) ~121 ГБ FP8 (4×H100) ~71 ГБ 147.3 t/s $0.60

Компромиссы видны наглядно: Lightning выдаёт в четыре-пять раз большую выходную скорость, чем Qwen3.8-27B, при цене в четырнадцать раз ниже, но набирает менее половины баллов по общей способности. Это подходит для агентного слоя исполнения, выполняющего чётко заданные шаги в объёме, и не подходит там, где исход решает один сложный проход рассуждения. Если вы как раз выбираете модель для агентных сценариев, полезно заранее оценить, где именно такие пилоты спотыкаются, — разбор типичных барьеров есть в материале про то, почему ИИ-агенты не доходят до продакшена.

Как выбрать между dense и MoE

Решение зависит от контекста развёртывания. Учитывать стоит несколько факторов.

Бюджет памяти. Объём памяти определяется общим числом параметров, а не активными: MoE на 30B и dense на 30B требуют примерно 60 ГБ. Вопрос в том, что вы получаете за эти гигабайты: dense превращает их в способность, MoE — в пропускную способность.

Конкурентность. На одиночном запросе MoE выигрывает явно. С ростом конкурентности преимущество по пропускной способности сохраняется, но разрыв по задержке сужается. Если задержка критична при высокой конкурентности, тестируйте обе модели перед решением.

Планы по дообучению. Дообучать dense-модель проще: все параметры активны, градиенты текут равномерно. Полное дообучение MoE может разбалансировать роутер — одни эксперты станут популярнее других, а некоторые могут вовсе выпасть. Подходы LoRA/PEFT помогают этого избежать, как и простое замораживание роутера. Рецепт supervised fine-tuning от NeMo для Lightning корректно решает это для конкретной модели.

Квантование. Степень сжатия — не там, где живёт архитектурная разница. Важнее другое. Первое: проверьте, в какой точности чекпойнт уже поставляется. Mistral Small 4 нативно в FP8, так что 4-bit даёт ещё примерно 1,7× (121 ГБ → 71 ГБ), а не 4×. Второе: у обеих архитектур есть модули, которые квантуются плохо, и это не одни и те же модули. В MoE это роутер, где малые возмущения переворачивают дискретные решения о маршрутизации. Рецепты держат роутер, эмбеддинги и выходную голову в более высокой точности, а в моделях с гибридным вниманием переворачивают решения рекуррентные проекции. Например, квантованные сборки Qwen3.8-27B держат блок linear-attention в BF16 именно поэтому.

Суть компромисса: dense и MoE — два ответа на один вопрос — способность на параметр против вычислений на токен. Dense оставляет всё простым и активным, поэтому его легче дообучать и обслуживать. MoE покупает пропускную способность за память и платит за это сложностью обслуживания.

Nemotron 3.5 Lightning полностью открыт: веса, данные и рецепты, так что модель можно адаптировать под свои процессы и развернуть где угодно. Начать можно на build.nvidia.com или через OpenRouter, веса скачать с Hugging Face и ModelScope. Для задач physical AI в экосистеме популярны AgiBot GO-1 и Tencent Hy-Embodied-VLM-1.0.

Частые вопросы

Чем MoE отличается от dense на уровне параметров?

Dense активирует все параметры на каждый токен через один общий FFN в слое декодера. MoE хранит несколько FFN-блоков-экспертов и через роутер направляет токен лишь в top-k из них, остальные в этом слое пропускаются.

Что такое активные параметры и почему их меньше общих?

Это параметры, реально участвующие в обработке одного токена. У Nemotron 3.5 Lightning 30 млрд общих параметров, но активны лишь 3 млрд: в счёт входят веса внимания и эмбеддингов плюс веса выбранных FFN, а не все эксперты.

Правда ли, что MoE всегда быстрее dense?

Нет. MoE обычно выигрывает по пропускной способности в токенах, но при высокой конкурентности маршрутизация и перемещение данных сужают отрыв, особенно по задержке. Итог зависит от железа, точности, фреймворка инференса и дизайна модели.

Сколько памяти нужно для MoE на 30B?

Столько же, сколько для dense на 30B, — примерно 60 ГБ. Память определяется общим числом параметров: все эксперты должны одновременно находиться в памяти GPU, поэтому под KV-кэш остаётся меньше места, чем у сопоставимой dense-модели.

Почему при равном размере моделей скорости так различаются?

Активация 3 млрд параметров на токен вместо 31 млрд — главная причина, но не единственная. У Nemotron 3.5 Lightning есть слои Mamba-2 и speculative decoding, которые дают вклад независимо от гибридной MoE-архитектуры.

Можно ли дообучать MoE-модель как обычную?

Полное дообучение может разбалансировать роутер: часть экспертов станет популярнее, а некоторые выпадут. Помогают подходы LoRA/PEFT и замораживание роутера; рецепт NeMo для Lightning решает эту задачу для конкретной модели.

Как квантование влияет на MoE иначе, чем на dense?

Плохо квантуемые модули у них разные. В MoE это роутер, где малые возмущения переворачивают дискретные решения о маршрутизации; в моделях с гибридным вниманием — рекуррентные проекции. Поэтому роутер, эмбеддинги и выходную голову держат в более высокой точности.

Когда стоит выбрать dense, а когда MoE?

Dense — когда важны простота обслуживания, предсказуемая задержка и лёгкое дообучение. MoE — когда есть бюджет памяти и нужна высокая пропускная способность на объёме хорошо заданных шагов, например в агентном слое исполнения. Сравнить несколько моделей по цене и качеству перед выбором помогает материал о том, как ранжировать ML-эксперименты до траты GPU-часов.

Источник: developer.nvidia.com