Meta представила Muse Glimmer — мультимодальную модель с 30 миллиардами параметров, дистиллированную из Muse Spark. Она заточена под постоянно работающих локальных ИИ-агентов и распространяется с открытыми весами под лицензией Apache 2.0. Ключевая особенность — модель запускается на одной потребительской видеокарте или Mac без обращения к облаку.
Обычно 30B-модель требует более 55 ГБ памяти в полной точности. Meta сжимает веса примерно до 4-битной точности и добавляет блочное спекулятивное декодирование, чтобы модель успевала отвечать в реальном цикле работы агента.
Что это за модель
Muse Glimmer — плотный каузальный трансформер с отдельным энкодером восприятия. Общее число параметров — около 30B, включая зрение. В групповом внимании (grouped-query attention) используется 32 query-головы и 2 KV-головы. Паттерн внимания — [Local, Local, Local, Global] со скользящим окном 2048 токенов. RoPE применяется только к локальным слоям с theta 500 000.
Зрительная часть — энкодер ViT-G/14 на ~1.8B параметров, принимающий до 4096 визуальных токенов на изображение. Контекст — 131 072+ токенов, словарь — 202 048 токенов, срез знаний — 4 января 2026 года. На вход принимаются текст и изображения, на выходе — текст. Аудио не поддерживается, видео обрабатывается как отдельные кадры.
Обучение проходило в три фазы:
- предобучение — дистилляция лог-вероятностей на выходах Muse Spark;
- промежуточная фаза — добавление длинноконтекстных данных с акцентом на агентные сценарии и цепочки рассуждений;
- постобучение — сочетание супервизионной тонкой настройки, дистилляции на политике и обучения с подкреплением в общих, рассуждающих, кодовых и агентных доменах.
Как 30B помещается в потребительское железо
В полной точности модели нужно более 55 ГБ памяти. Сжатие весов до примерно 4-битной точности уменьшает языковую часть до менее 20 ГБ. Оставшееся место в пределах 24 или 32 ГБ делят KV-кэш, энкодер восприятия и драфтер.
Meta выпускает два квантованных варианта:
- K-Quant-Dynamic — для 32 ГБ VRAM, средняя деградация 0.2%;
- K-Quant-17GB — для 24 ГБ VRAM, деградация 1.0%.
Деградация усреднена по метрикам точности на 15 распространённых бенчмарках.
Скорость генерации обеспечивает DFlash — блочный диффузионный драфтер, предсказывающий 16 токенов за один проход. Основная модель проверяет блок параллельно. Драфтер использует 5 слоёв, скользящее окно 2048 и 32 query / 8 KV голов.
Замеры для K-Quant-17GB при batch size 1 и жадном декодировании:
- RTX 5090 — пропускная способность выросла с 74.9 до 233.4 ток/с, ускорение в 3.1 раза;
- Apple M5 Max — с 26.6 до 50.2 ток/с;
- Apple M4 Max — с 23.7 до 37.8 ток/с.
Бенчмарки и безопасность
Meta сравнивает Muse Glimmer с Gemma4-31B и Qwen3.6-27B в режиме рассуждений. Muse Glimmer лидирует на MCP Atlas (75.5 против 54.2 и 62.5), DeepSearch QA (74.6), Gaia2 (43.3) и SWE-Bench Pro (51.2). Показатели рассуждений: AIME 2026 — 94.7, IFBench — 77.0, AA-LCR — 80.0.
Qwen3.6-27B остаётся впереди на OSWorld-Verified (75.6 против 65.9), TerminalBench 2.1 (60.7) и SWE-Bench Verified (77.2). Закономерность последовательна: Muse Glimmer выигрывает в агентной оркестрации и рассуждениях, но уступает в работе с компьютером и терминалом.
По безопасности: success rate атаки Siren AgentDojo — 28.4 при utility 94.2. Meta заявляет, что модель не подпадает под определение Frontier AI в её Advanced AI Scaling Framework. Риски chem/bio, cyber и потери контроля оцениваются как умеренные или ниже.
Для кого и где применять
Соло-разработчики и стартапы могут запустить модель на одной видеокарте с 24 ГБ или на Mac M4/M5 Max. Средним командам доступен инференс внутри периметра без оплаты за токен. Регулируемые предприятия получают агента, который можно изолировать от сети.
Meta советует добавлять системные защитные механизмы (guardrails), а не публиковать модель как голый endpoint.
Отрасли применения: здравоохранение, юриспруденция, финансовые услуги, оборонный и государственный сектор, производство и полевые сервисы — сценарии, где требования к хранению данных, офлайн-работе или задержкам исключают вызов облака.
Типовые задачи: десктопные агенты, читающие скриншоты, кодинг-агенты, вызов функций на основе схем, понимание документов и графиков, генерация синтетических данных и оценка LLM-as-a-judge. Как и Pokee-Isaac 28B, Muse Glimmer ориентирована на работу внутри периметра, но предлагает мультимодальность и меньший контекст. Для задач, требующих высокой скорости на устройстве, также актуальны решения вроде Liquid AI LFM2.5-2.6B.
Где взять веса
Коллекция на Hugging Face содержит веса BF16, кванты GGUF, сборки ExecuTorch и драфтер DFlash. Сам-хостинг — основной путь развёртывания с первого дня. Это делает Muse Glimmer привлекательной альтернативой облачным агентам, особенно на фоне роста интереса к локальным моделям, таким как NVIDIA NemotronLabs VoiceChat 11B.
Частые вопросы
Какое железо нужно для запуска Muse Glimmer?
Достаточно одной потребительской видеокарты с 24 ГБ VRAM (вариант K-Quant-17GB) или 32 ГБ (K-Quant-Dynamic). Также поддерживаются Mac на чипах M4/M5 Max.
Насколько сильно квантование ухудшает качество?
Вариант для 24 ГБ VRAM теряет в среднем 1.0% точности на 15 бенчмарках, вариант для 32 ГБ — 0.2%. Это усреднённые значения по метрикам точности.
Что такое DFlash и зачем он нужен?
DFlash — блочный драфтер, который предсказывает 16 токенов за один прямой проход, а основная модель проверяет блок параллельно. На RTX 5090 это даёт ускорение генерации в 3.1 раза.
Подходит ли модель для офлайн-сценариев?
Да, модель работает полностью локально без сетевых вызовов, что делает её пригодной для изолированных сред и регулируемых отраслей.
Чем Muse Glimmer отличается от Muse Spark?
Muse Glimmer — это дистиллированная версия Muse Spark: меньше ресурсов при сохранении агентных возможностей, открытые веса под Apache 2.0.
В каких задачах модель уступает конкурентам?
Muse Glimmer проигрывает Qwen3.6-27B в работе с компьютером (OSWorld-Verified) и терминалом (TerminalBench 2.1), но лидирует в агентной оркестрации и рассуждениях.
Какие форматы весов доступны?
В коллекции на Hugging Face есть BF16-веса, GGUF-кванты, сборки ExecuTorch и драфтер DFlash — можно выбрать под свою среду запуска.
Источник: marktechpost.com