Muse Glimmer: 30B-модель Meta с открытыми весами помещается в 24 ГБ VRAM

Meta представила Muse Glimmer — мультимодальную модель с 30 миллиардами параметров, дистиллированную из Muse Spark. Она заточена под постоянно работающих локальных ИИ-агентов и распространяется с открытыми весами под лицензией Apache 2.0. Ключевая особенность — модель запускается на одной потребительской видеокарте или Mac без обращения к облаку.

Обычно 30B-модель требует более 55 ГБ памяти в полной точности. Meta сжимает веса примерно до 4-битной точности и добавляет блочное спекулятивное декодирование, чтобы модель успевала отвечать в реальном цикле работы агента.

Что это за модель

Muse Glimmer — плотный каузальный трансформер с отдельным энкодером восприятия. Общее число параметров — около 30B, включая зрение. В групповом внимании (grouped-query attention) используется 32 query-головы и 2 KV-головы. Паттерн внимания — [Local, Local, Local, Global] со скользящим окном 2048 токенов. RoPE применяется только к локальным слоям с theta 500 000.

Зрительная часть — энкодер ViT-G/14 на ~1.8B параметров, принимающий до 4096 визуальных токенов на изображение. Контекст — 131 072+ токенов, словарь — 202 048 токенов, срез знаний — 4 января 2026 года. На вход принимаются текст и изображения, на выходе — текст. Аудио не поддерживается, видео обрабатывается как отдельные кадры.

Обучение проходило в три фазы:

  • предобучение — дистилляция лог-вероятностей на выходах Muse Spark;
  • промежуточная фаза — добавление длинноконтекстных данных с акцентом на агентные сценарии и цепочки рассуждений;
  • постобучение — сочетание супервизионной тонкой настройки, дистилляции на политике и обучения с подкреплением в общих, рассуждающих, кодовых и агентных доменах.

Как 30B помещается в потребительское железо

В полной точности модели нужно более 55 ГБ памяти. Сжатие весов до примерно 4-битной точности уменьшает языковую часть до менее 20 ГБ. Оставшееся место в пределах 24 или 32 ГБ делят KV-кэш, энкодер восприятия и драфтер.

Meta выпускает два квантованных варианта:

  • K-Quant-Dynamic — для 32 ГБ VRAM, средняя деградация 0.2%;
  • K-Quant-17GB — для 24 ГБ VRAM, деградация 1.0%.

Деградация усреднена по метрикам точности на 15 распространённых бенчмарках.

Скорость генерации обеспечивает DFlash — блочный диффузионный драфтер, предсказывающий 16 токенов за один проход. Основная модель проверяет блок параллельно. Драфтер использует 5 слоёв, скользящее окно 2048 и 32 query / 8 KV голов.

Замеры для K-Quant-17GB при batch size 1 и жадном декодировании:

  • RTX 5090 — пропускная способность выросла с 74.9 до 233.4 ток/с, ускорение в 3.1 раза;
  • Apple M5 Max — с 26.6 до 50.2 ток/с;
  • Apple M4 Max — с 23.7 до 37.8 ток/с.

Бенчмарки и безопасность

Meta сравнивает Muse Glimmer с Gemma4-31B и Qwen3.6-27B в режиме рассуждений. Muse Glimmer лидирует на MCP Atlas (75.5 против 54.2 и 62.5), DeepSearch QA (74.6), Gaia2 (43.3) и SWE-Bench Pro (51.2). Показатели рассуждений: AIME 2026 — 94.7, IFBench — 77.0, AA-LCR — 80.0.

Qwen3.6-27B остаётся впереди на OSWorld-Verified (75.6 против 65.9), TerminalBench 2.1 (60.7) и SWE-Bench Verified (77.2). Закономерность последовательна: Muse Glimmer выигрывает в агентной оркестрации и рассуждениях, но уступает в работе с компьютером и терминалом.

По безопасности: success rate атаки Siren AgentDojo — 28.4 при utility 94.2. Meta заявляет, что модель не подпадает под определение Frontier AI в её Advanced AI Scaling Framework. Риски chem/bio, cyber и потери контроля оцениваются как умеренные или ниже.

Для кого и где применять

Соло-разработчики и стартапы могут запустить модель на одной видеокарте с 24 ГБ или на Mac M4/M5 Max. Средним командам доступен инференс внутри периметра без оплаты за токен. Регулируемые предприятия получают агента, который можно изолировать от сети.

Meta советует добавлять системные защитные механизмы (guardrails), а не публиковать модель как голый endpoint.

Отрасли применения: здравоохранение, юриспруденция, финансовые услуги, оборонный и государственный сектор, производство и полевые сервисы — сценарии, где требования к хранению данных, офлайн-работе или задержкам исключают вызов облака.

Типовые задачи: десктопные агенты, читающие скриншоты, кодинг-агенты, вызов функций на основе схем, понимание документов и графиков, генерация синтетических данных и оценка LLM-as-a-judge. Как и Pokee-Isaac 28B, Muse Glimmer ориентирована на работу внутри периметра, но предлагает мультимодальность и меньший контекст. Для задач, требующих высокой скорости на устройстве, также актуальны решения вроде Liquid AI LFM2.5-2.6B.

Где взять веса

Коллекция на Hugging Face содержит веса BF16, кванты GGUF, сборки ExecuTorch и драфтер DFlash. Сам-хостинг — основной путь развёртывания с первого дня. Это делает Muse Glimmer привлекательной альтернативой облачным агентам, особенно на фоне роста интереса к локальным моделям, таким как NVIDIA NemotronLabs VoiceChat 11B.

Частые вопросы

Какое железо нужно для запуска Muse Glimmer?

Достаточно одной потребительской видеокарты с 24 ГБ VRAM (вариант K-Quant-17GB) или 32 ГБ (K-Quant-Dynamic). Также поддерживаются Mac на чипах M4/M5 Max.

Насколько сильно квантование ухудшает качество?

Вариант для 24 ГБ VRAM теряет в среднем 1.0% точности на 15 бенчмарках, вариант для 32 ГБ — 0.2%. Это усреднённые значения по метрикам точности.

Что такое DFlash и зачем он нужен?

DFlash — блочный драфтер, который предсказывает 16 токенов за один прямой проход, а основная модель проверяет блок параллельно. На RTX 5090 это даёт ускорение генерации в 3.1 раза.

Подходит ли модель для офлайн-сценариев?

Да, модель работает полностью локально без сетевых вызовов, что делает её пригодной для изолированных сред и регулируемых отраслей.

Чем Muse Glimmer отличается от Muse Spark?

Muse Glimmer — это дистиллированная версия Muse Spark: меньше ресурсов при сохранении агентных возможностей, открытые веса под Apache 2.0.

В каких задачах модель уступает конкурентам?

Muse Glimmer проигрывает Qwen3.6-27B в работе с компьютером (OSWorld-Verified) и терминалом (TerminalBench 2.1), но лидирует в агентной оркестрации и рассуждениях.

Какие форматы весов доступны?

В коллекции на Hugging Face есть BF16-веса, GGUF-кванты, сборки ExecuTorch и драфтер DFlash — можно выбрать под свою среду запуска.

Источник: marktechpost.com