Модель на 30 млрд параметров может активировать лишь 3 млрд на каждый токен — и при этом использовать ёмкость всей сети. Именно так устроена Nemotron 3.5 Lightning: архитектура Mixture-of-Experts (MoE) выбирает для каждого токена лишь часть параметров. Как организованы параметры модели, часто важнее их количества: выбор между dense и MoE сильнее влияет на пропускную способность, расход памяти и сложность обслуживания, чем сырое число параметров.
Разница похожа на два двигателя одинакового объёма: один сжигает топливо во всех цилиндрах каждый такт, второй подключает только нужные.
Как устроены dense- и MoE-модели
В dense-модели каждый параметр участвует в каждом прямом проходе. Все 27 млрд параметров модели на 27 млрд срабатывают для каждого токена через один общий блок feed-forward network (FFN) в каждом слое декодера.
MoE-модель заменяет этот единый FFN несколькими FFN-блоками — экспертами. Внутренний механизм маршрутизации пропускает входящие токены через небольшую часть экспертов, а не через все параметры. Структурно: там, где у dense-модели в слое декодера один FFN, у MoE-слоя их несколько (например, 8, 64 или 128). Перед ними стоит обученная gate-сеть, обычно называемая сетью-роутером (router network): она назначает каждый токен top-k экспертам с наивысшим скором. Выбранные FFN-блоки и выполняются для этого токена, остальные в данном слое пропускаются. Большинство современных MoE, включая Mistral Small 4, дополнительно прогоняют один «общий» эксперт, куда токен попадает всегда.
Как работает маршрутизация в MoE
Решение о маршрутизации принимается отдельно для каждого слоя: токен не закрепляется за экспертом до конца вычислений. На каждом слое декодера он перенаправляется заново, исходя из того, что представляет собой на этом этапе сети. Эксперты здесь — не специалисты по предметным областям в привычном смысле: их специализация лежит в первую очередь в синтаксисе и типах токенов (пунктуация, числа и т. п.), хотя это зависит от архитектуры и методов обучения.
Пока роутер решает, какие FFN-блоки пропустить на каждом слое, токены всё равно проходят через полный механизм внимания. Когда карточка модели говорит «3 млрд активных параметров», туда входят и веса внимания, и веса эмбеддингов для каждого токена, а также веса выбранных FFN.
У MoE есть варианты. Так, карточка NVIDIA для Nemotron 3.5 Lightning описывает гибрид Mamba-2 + MoE + Attention. Слои Mamba-2 заменяют внимание в большинстве слоёв и несут рекуррентное состояние постоянного размера вместо растущего KV-кэша. Это меняет профиль памяти на длинном контексте так, как одна разреженность не объясняет. Lightning к тому же сжимает пространство решений перед маршрутизацией, чтобы решение давалось модели дешевле. Отметим: MoE — это разновидность разреженной (sparse) модели.
Что быстрее: dense или MoE
MoE обычно быстрее по пропускной способности в токенах: на каждый токен активируется лишь часть feed-forward параметров. Dense-модели задействуют всю сеть, зато дают более простое обслуживание и предсказуемую задержку.
При высокой конкурентности маршрутизация и перемещение данных сужают преимущество MoE. Результат зависит от железа, точности, фреймворка инференса и дизайна модели. Например, у Nemotron 3.5 Lightning есть слои Mamba-2 и speculative decoding.
Ключевое различие — в двух вещах. Во-первых, при равном общем числе параметров пропущенные FFN-блоки делают MoE быстрее. Во-вторых, MoE развязывает память (общее число параметров → VRAM) и вычисления (активные параметры → FLOPs на токен). В dense-модели расходы на хостинг и инференс растут вместе, а MoE эту связь разрывает: VRAM платится заранее, а вычисления — за токен и масштабируются только по сработавшим экспертам. Простаивающие эксперты не стоят вычислений, но память под них всё равно выделена — в этом и главный компромисс: переменные вычисления на токен против фиксированной памяти.
При размере батча 1 декодирование ограничено доступной памятью, а не вычислениями, — и здесь MoE показывает себя хорошо, читая меньше байтов весов на токен. С ростом батча токены коллективно задействуют большинство экспертов, и преимущество сужается, хотя сокращение работы на токен сохраняется. MoE удерживает преимущество по пропускной способности на всех размерах батча, но отрыв по задержке от хорошо оптимизированной dense-модели сжимается при высокой конкурентности.
Современные фреймворки инференса обычно обрабатывают маршрутизацию без отбрасывания токенов, но все эксперты должны одновременно находиться в памяти GPU. Это оставляет меньше места под KV-кэш, чем у dense-модели сопоставимого размера.
Сравнение на примере
При равном общем размере разреженность прямо видна в пропускной способности. Gemma 4 31B и Nemotron 3.5 Lightning — обе примерно на 30 млрд параметров, но диапазоны их выходной скорости у провайдеров GPU не пересекаются. Активация 3 млрд параметров на токен — важная причина, хотя не единственная: слои Mamba-2 и speculative decoding в Lightning дают вклад независимо от гибридной MoE-архитектуры.
| Модель | Архитектура | Всего параметров | Активных | VRAM (нативная) | VRAM (4-bit) | Output speed | $/M output |
|---|---|---|---|---|---|---|---|
| Gemma 4 31B | Dense; мультимодальная | 31B | 31B | ~61 ГБ BF16 (1×H100) | ~16 ГБ | 36.9–222.4 t/s | $0.40 |
| Qwen3.8-27B | Dense; гибрид linear/full attention; MTP head; мультимодальная | 27B | 27B | ~56 ГБ BF16 (1×H100) | ~14 ГБ | 46.8 t/s | $3.00 |
| Nemotron 3.5 Lightning | MoE + Mamba-2 attention hybrid | 30B | 3B | ~60 ГБ BF16 (1×H100) | ~20 ГБ | 235.7–494.2 t/s | $0.22 |
| Mistral Small 4 | MoE; мультимодальная | 119B | 6B (8B с эмбеддингами) | ~121 ГБ FP8 (4×H100) | ~71 ГБ | 147.3 t/s | $0.60 |
Компромиссы видны наглядно: Lightning выдаёт в четыре-пять раз большую выходную скорость, чем Qwen3.8-27B, при цене в четырнадцать раз ниже, но набирает менее половины баллов по общей способности. Это подходит для агентного слоя исполнения, выполняющего чётко заданные шаги в объёме, и не подходит там, где исход решает один сложный проход рассуждения. Если вы как раз выбираете модель для агентных сценариев, полезно заранее оценить, где именно такие пилоты спотыкаются, — разбор типичных барьеров есть в материале про то, почему ИИ-агенты не доходят до продакшена.
Как выбрать между dense и MoE
Решение зависит от контекста развёртывания. Учитывать стоит несколько факторов.
Бюджет памяти. Объём памяти определяется общим числом параметров, а не активными: MoE на 30B и dense на 30B требуют примерно 60 ГБ. Вопрос в том, что вы получаете за эти гигабайты: dense превращает их в способность, MoE — в пропускную способность.
Конкурентность. На одиночном запросе MoE выигрывает явно. С ростом конкурентности преимущество по пропускной способности сохраняется, но разрыв по задержке сужается. Если задержка критична при высокой конкурентности, тестируйте обе модели перед решением.
Планы по дообучению. Дообучать dense-модель проще: все параметры активны, градиенты текут равномерно. Полное дообучение MoE может разбалансировать роутер — одни эксперты станут популярнее других, а некоторые могут вовсе выпасть. Подходы LoRA/PEFT помогают этого избежать, как и простое замораживание роутера. Рецепт supervised fine-tuning от NeMo для Lightning корректно решает это для конкретной модели.
Квантование. Степень сжатия — не там, где живёт архитектурная разница. Важнее другое. Первое: проверьте, в какой точности чекпойнт уже поставляется. Mistral Small 4 нативно в FP8, так что 4-bit даёт ещё примерно 1,7× (121 ГБ → 71 ГБ), а не 4×. Второе: у обеих архитектур есть модули, которые квантуются плохо, и это не одни и те же модули. В MoE это роутер, где малые возмущения переворачивают дискретные решения о маршрутизации. Рецепты держат роутер, эмбеддинги и выходную голову в более высокой точности, а в моделях с гибридным вниманием переворачивают решения рекуррентные проекции. Например, квантованные сборки Qwen3.8-27B держат блок linear-attention в BF16 именно поэтому.
Суть компромисса: dense и MoE — два ответа на один вопрос — способность на параметр против вычислений на токен. Dense оставляет всё простым и активным, поэтому его легче дообучать и обслуживать. MoE покупает пропускную способность за память и платит за это сложностью обслуживания.
Nemotron 3.5 Lightning полностью открыт: веса, данные и рецепты, так что модель можно адаптировать под свои процессы и развернуть где угодно. Начать можно на build.nvidia.com или через OpenRouter, веса скачать с Hugging Face и ModelScope. Для задач physical AI в экосистеме популярны AgiBot GO-1 и Tencent Hy-Embodied-VLM-1.0.
Частые вопросы
Чем MoE отличается от dense на уровне параметров?
Dense активирует все параметры на каждый токен через один общий FFN в слое декодера. MoE хранит несколько FFN-блоков-экспертов и через роутер направляет токен лишь в top-k из них, остальные в этом слое пропускаются.
Что такое активные параметры и почему их меньше общих?
Это параметры, реально участвующие в обработке одного токена. У Nemotron 3.5 Lightning 30 млрд общих параметров, но активны лишь 3 млрд: в счёт входят веса внимания и эмбеддингов плюс веса выбранных FFN, а не все эксперты.
Правда ли, что MoE всегда быстрее dense?
Нет. MoE обычно выигрывает по пропускной способности в токенах, но при высокой конкурентности маршрутизация и перемещение данных сужают отрыв, особенно по задержке. Итог зависит от железа, точности, фреймворка инференса и дизайна модели.
Сколько памяти нужно для MoE на 30B?
Столько же, сколько для dense на 30B, — примерно 60 ГБ. Память определяется общим числом параметров: все эксперты должны одновременно находиться в памяти GPU, поэтому под KV-кэш остаётся меньше места, чем у сопоставимой dense-модели.
Почему при равном размере моделей скорости так различаются?
Активация 3 млрд параметров на токен вместо 31 млрд — главная причина, но не единственная. У Nemotron 3.5 Lightning есть слои Mamba-2 и speculative decoding, которые дают вклад независимо от гибридной MoE-архитектуры.
Можно ли дообучать MoE-модель как обычную?
Полное дообучение может разбалансировать роутер: часть экспертов станет популярнее, а некоторые выпадут. Помогают подходы LoRA/PEFT и замораживание роутера; рецепт NeMo для Lightning решает эту задачу для конкретной модели.
Как квантование влияет на MoE иначе, чем на dense?
Плохо квантуемые модули у них разные. В MoE это роутер, где малые возмущения переворачивают дискретные решения о маршрутизации; в моделях с гибридным вниманием — рекуррентные проекции. Поэтому роутер, эмбеддинги и выходную голову держат в более высокой точности.
Когда стоит выбрать dense, а когда MoE?
Dense — когда важны простота обслуживания, предсказуемая задержка и лёгкое дообучение. MoE — когда есть бюджет памяти и нужна высокая пропускная способность на объёме хорошо заданных шагов, например в агентном слое исполнения. Сравнить несколько моделей по цене и качеству перед выбором помогает материал о том, как ранжировать ML-эксперименты до траты GPU-часов.
Источник: developer.nvidia.com