JetBrains выпустила Mellum2.1 — открытую thinking-модель для кодинг-агентов и быстрых субагентов. Это mixture-of-experts на 12B параметров, из которых на каждый токен активируется 2.5B. Веса выложены на Hugging Face под лицензией Apache 2.0, запускать модель можно на собственных GPU.
Главное отличие от предыдущей версии — не архитектура, а посттренировка. Почти весь прирост дал reinforcement learning, перенесённый из короткой финальной стадии в основную часть обучения. Тот же путь — ставка на открытые веса и посттренировку под конкретную задачу — виден и в других недавних релизах, например у Cognition SWE-2 и Beam от Reflection AI.
Что внутри Mellum2.1
Релизный чекпоинт называется Mellum2.1-12B-A2.5B-Thinking. Это reasoning-модель: перед ответом она выдаёт цепочку рассуждений. JetBrains видит три сценария применения — рабочий агент, универсальный ассистент для рассуждений и приватное развёртывание на своём железе.
Архитектурные параметры:
- 28 слоёв, 64 эксперта, роутер активирует 8 экспертов на токен;
- grouped-query attention: 32 query-головы и 4 KV-головы;
- 3 из каждых 4 слоёв используют скользящее окно в 1 024 токена;
- контекст — 131 072 токена, словарь — 98 304 токена;
- веса в bfloat16.
Как обучали
Новая работа почти целиком ушла в посттренировку. JetBrains добавила RL-задачи по математике, спортивному программированию, науке, работе с инструментами и разработке ПО. Открытые RL-датасеты фильтровали: убирали сломанные тесты, непроверяемые ответы и задачи, которые слишком просты или нерешаемы.
Для software engineering модель тренируется в реальных репозиториях с shell и инструментами редактирования файлов. Награда начисляется, когда тесты проходят. Обучение запускало миллионы песочниц в тысячах окружений.
Результаты в бенчмарках
JetBrains прогнала Mellum2.1, Mellum2, Qwen3.5-9B и Gemma 4 E4B через один пайплайн в thinking-режиме. Все оценки — самозаявленные вендором.
Самый крупный скачок — в агентном кодинге. SWE-bench Verified вырос с 2.0 до 47.0, SWE-bench Pro — с 0.0 до 28.0, Terminal-Bench 2.1 — с 0.6 до 17.4. Агентные прогоны выполнялись на открытом харнессе Pi v0.73.1 с контекстом 114K токенов.
Mellum2.1 лидирует в своей группе на LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) и BFCL v4 (62.3). Qwen3.5-9B по-прежнему впереди на SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) и GPQA Diamond (77.8). Улучшилась и безопасность: HarmBench снизился с 21.5 до 8.5, где меньше — лучше.
Сравнивать цифры разных вендоров напрямую нельзя. Карточка Qwen указывает 65.6 на LiveCodeBench v6 и 81.7 на GPQA Diamond, а JetBrains на том же пайплайне получила для этой модели 75.4 и 77.8.
Скорость и запуск на своём железе
Посттренировка не тронула архитектуру, поэтому скорость совпадает с Mellum2. На одной NVIDIA H200 под высокой нагрузкой Mellum2.1 обслуживает почти вдвое больше токенов, чем Qwen3.5-9B. На одиночном запросе multi-token prediction ускоряет примерно в 1.6 раза. Голова MTP для speculative decoding в vLLM пока заявлена как «скоро».
Полная модель поднимается на vLLM с флагом --reasoning-parser qwen3. Для вызова инструментов добавляются --enable-auto-tool-choice --tool-call-parser hermes. Рекомендованные параметры сэмплинга: temperature 0.6, top_p 0.95, top_k 20.
GGUF-сборки ещё в работе, но репозиторий уже содержит 5 файлов:
| Квантование | Размер | Совпадение top-токенов |
|---|---|---|
| BF16 | 24.3 GB | эталон |
| Q8_0 | 12.9 GB | 96.1% |
| Q6_K | 10.9 GB | 93.9% |
| Q4_K_M | 8.1 GB | 88.0% (рекомендуется) |
| MXFP4_MOE | 7.0 GB | 85.6% |
Сборки рассчитаны на llama.cpp, Ollama и LM Studio. Именно компактные кванты делают локальных кодинг-субагентов практичными: 7–8 ГБ — это уже ноутбук или рабочая станция без серверных GPU. Похожая логика — у открытых decision-моделей Liquid AI, которые тоже рассчитаны на запуск в приватном контуре.
Что это значит для локального развёртывания
Mellum2.1 — продолжение Mellum2 Thinking, открытого в июне 2026 года. Для команд, которые не могут отправлять код во внешние API, это редкий вариант: открытая лицензия, reasoning, вызов инструментов и агентный цикл в одном чекпоинте, причём с реальными требованиями к железу ниже, чем у плотных моделей сопоставимого качества.
Трезвый взгляд на цифры: модель выигрывает у Qwen3.5-9B на задачах генерации кода и вызова функций, но проигрывает на сложных агентных сценариях и в знаниях. Для тяжёлых задач лучше держать вторую модель, а Mellum2.1 использовать как быстрого исполнителя.
Частые вопросы
Кого касается релиз?
Команд, которые хотят развернуть кодинг-агента на своём железе: 12B MoE с 2.5B активных параметров и открытой лицензией Apache 2.0 подходит для приватного контура, где код нельзя отправлять в облако.
Какой чекпоинт выложен?
Mellum2.1-12B-A2.5B-Thinking — reasoning-версия, которая выдаёт цепочку рассуждений перед ответом.
Сколько параметров активируется на токен?
2.5B из 12B общих. Роутер выбирает 8 экспертов из 64 на каждый токен.
Какой контекст поддерживается?
131 072 токена. Три из четырёх слоёв используют скользящее окно в 1 024 токена.
Как запустить модель локально?
Полную версию — на vLLM с --reasoning-parser qwen3. Для вызова инструментов добавьте --enable-auto-tool-choice --tool-call-parser hermes. Сэмплинг: temperature 0.6, top_p 0.95, top_k 20.
Сколько места займут GGUF-сборки?
От 7.0 GB (MXFP4_MOE) до 24.3 GB (BF16). Рекомендуемый вариант Q4_K_M — 8.1 GB при совпадении top-токенов 88.0%.
Насколько модель лучше предыдущей?
SWE-bench Verified вырос с 2.0 до 47.0, SWE-bench Pro — с 0.0 до 28.0, Terminal-Bench 2.1 — с 0.6 до 17.4. Mellum2.1 обошла Mellum2 на 15 из 17 заявленных бенчмарков.
Обгоняет ли она Qwen3.5-9B?
Не во всём. Mellum2.1 берёт 5 из 17 бенчмарков и лидирует на LiveCodeBench v6 (82.0), HumanEval+ (91.5), MBPP+ (79.4) и BFCL v4 (62.3). Qwen3.5-9B впереди на SWE-bench Verified (50.0), SWE-bench Pro (38.0), AIME 25/26 (86.7) и GPQA Diamond (77.8).
Насколько быстро работает под нагрузкой?
На одной NVIDIA H200 JetBrains заявляет почти вдвое больше токенов в секунду, чем Qwen3.5-9B, а multi-token prediction ускоряет одиночный запрос примерно в 1.6 раза.
Можно ли доверять цифрам бенчмарков?
Все оценки самозаявленные. Карточка Qwen для той же модели указывает другие числа, поэтому сравнивать результаты нужно только внутри одного пайплайна.
Что с безопасностью?
HarmBench снизился с 21.5 до 8.5 — чем меньше, тем лучше. Это означает меньше опасных ответов на провокационные запросы.
Где взять веса?
На Hugging Face под Apache 2.0. Там же лежат GGUF-сборки для llama.cpp, Ollama и LM Studio; JetBrains также опубликовала технический блог и отчёт по Mellum2.
Источник: marktechpost.com