Saluki 27B: 2-битная сборка Qwen3.8-27B уместилась в 7,89 ГБ и обошла оригинал в вызове инструментов

Underdog — ассистент, работающий на устройстве, от Conway Research — выложила Saluki 27B под лицензией Apache 2.0. Это 2-битный GGUF модели Qwen3.8-27B, который занимает 7,89 ГБ вместо 54 ГБ у полной версии в BF16. Сжатие настраивали так, чтобы сохранить вызов инструментов — навык, превращающий чат-модель в агента. Для разработчиков это означает агентную модель класса 27B, запускаемую в штатном llama.cpp.

Что внутри Saluki 27B

Saluki 27B — это 2-битный GGUF смешанной точности на базе Qwen3.8-27B, собранный для локальных агентов. В основе лежит Qwen3.8-27B — плотная модель на 27B от команды Qwen: 64 слоя, комбинация линейного внимания Gated DeltaNet с gated attention и нативная поддержка 262 144 токенов.

Второй слой — Qwen3.8-27B-GSQ-RCO-GGUF от ISTA-DASLab. Метод GSQ подбирает точные низкобитные скалярные сетки для каждого тензора, RCO назначает тип квантования каждому тензору в рамках фиксированного бюджета размера. Самый маленький файл ISTA, IQ2_XS, весит 8,4 ГБ при 2,50 бита на вес.

Третий слой — собственный проход Underdog. Компания уменьшила файл до 7,89 ГБ и нацелила его на вызов инструментов. Файл называется IQ2-mix и несёт тег imatrix. Полный рецепт этого прохода Underdog не опубликовала.

Результаты: где сборка выигрывает, а где проигрывает

Underdog делит результаты на две группы. Первая — прогон обеих моделей в одном и том же стенде:

  • Underdog Bench: 120 задач из BFCL v4, зафиксированных до тестирования. Режим размышлений выключен, temperature 0. Saluki набирает 88, полная модель — 84, Bonsai 2 от PrismML — 70.
  • Параллельные вызовы инструментов: 100 параллельных задач BFCL v4 с официальным чекером. Saluki — 42, полная модель — 35.
  • SWE-bench Verified: 50 задач. Saluki исправляет 30, полная модель — 33.

Вторая группа сравнивает Saluki с публичными результатами полноразмерной модели:

Бенчмарк Saluki 27B Qwen3.8-27B (публично)
IFEval (prompt-loose) 93,5 91,5
IFBench (prompt-loose) 72,7 71,0
MBPP+ 78,0 83,9
MuSR 67,5 79,6
AIME 2025 (avg@4) 79,2 96,7
AIME 2026 (avg@4) 80,0 94,6

Среднее удержание по 9 бенчмаркам — 96% относительно полной Qwen3.8-27B. Лучший результат — параллельные вызовы инструментов: 42 против 35 (120% удержания). Худший — AIME 2025: 79,2 против 96,7 (около 82%). Соревновательная математика и многошаговые рассуждения проседают на 12–18 пунктов.

Как Saluki выглядит на фоне других компактных сборок

Характеристика Saluki 27B Qwen3.8-27B (BF16) ISTA GSQ-RCO IQ2_XS PrismML Bonsai 2 27B (PTQ1_0)
Организация Underdog (Conway Research) команда Qwen ISTA-DASLab PrismML
Параметры 27B 27B 27B 27,36B
Размер файла 7,89 ГБ 54 ГБ 8,4 ГБ 5,95 ГБ
Бит на вес не раскрыто (2-битная смесь) 16 2,50 1,75
Контекст не раскрыто 262 144 нативно не раскрыто 262K
Зрение надстройка, 629 или 928 МБ нативно 0,9 ГБ mmproj опционально 0,63 ГБ
Среда выполнения штатный llama.cpp Transformers, vLLM, SGLang штатный llama.cpp, Ollama, LM Studio форк llama.cpp от PrismML
Underdog Bench (из 120) 88 84 не раскрыто 70
Заявление вендора 96% среднего удержания, 9 бенчмарков базовая линия 100,3% восстановления zero-shot 98,2% от FP16, 14 бенчмарков
Лицензия Apache 2.0 Apache 2.0 Apache 2.0 Apache 2.0

Bonsai 2 меньше по размеру и заявляет 98,2% удержания на 14 бенчмарках в режиме размышлений, а также более сильную математику, включая 95,00 на AIME25. Но ей нужен форк llama.cpp от PrismML: штатный llama.cpp отвергает её форматы упаковки. Saluki работает на штатном llama.cpp. Каждый вендор использует собственный стенд, поэтому межвендорные результаты напрямую не сравнимы.

Что это значит для локальных агентов

Главный практический вывод: 27B-класс агентной модели теперь помещается в файл меньше 8 ГБ и запускается на штатном llama.cpp с полной выгрузкой на GPU. Опционально добавляется зрение — надстройка на 629 или 928 МБ. Лицензия Apache 2.0 не накладывает ограничений на коммерческое использование.

Плата за компактность — математика и многошаговые рассуждения. Если задача требует соревновательной математики или длинных цепочек вывода, просадка в 12–18 пунктов относительно полной модели может оказаться решающей. Если же основной сценарий — агент с вызовом инструментов, сборка не только не уступает оригиналу, но и обходит его.

Для администраторов, разворачивающих локальный инференс, Saluki снимает главное ограничение: раньше модель класса 27B требовала 54 ГБ под веса, теперь — меньше 8 ГБ, что укладывается в память одной потребительской видеокарты. Похожие подходы к экономии ресурсов на локальном железе применяются и в других проектах — например, движок инференса MoE FreeToken запускает 753B-модель на одной рабочей станции, а ThinkingCap-Qwen3.8-27B сокращает расход токенов рассуждения на 37,2% ценой 0,86 п.п. точности.

Частые вопросы

Кого касается эта новость?

Разработчиков и администраторов, которые запускают локальные агентные модели: Saluki 27B работает на штатном llama.cpp с полной выгрузкой на GPU и занимает 7,89 ГБ вместо 54 ГБ у полной версии в BF16.

Насколько сборка хуже полной модели?

Среднее удержание по 9 бенчмаркам — 96%. В вызове инструментов сборка обходит оригинал (88 против 84), но в математике и многошаговых рассуждениях проседает на 12–18 пунктов: AIME 2025 — 79,2 против 96,7.

Нужен ли особый форк llama.cpp?

Нет. Saluki работает на штатном llama.cpp и приложениях на его основе. Это отличает её от Bonsai 2 от PrismML, которой нужен собственный форк, поскольку штатный llama.cpp отвергает её форматы упаковки.

Какая лицензия у модели?

Apache 2.0. Под той же лицензией выложены Qwen3.8-27B, IQ2_XS от ISTA-DASLab и Bonsai 2 от PrismML.

Есть ли поддержка зрения?

Да, опционально. Надстройка для обработки изображений весит 629 или 928 МБ. У полной Qwen3.8-27B зрение встроено нативно.

Какой контекст поддерживает Saluki?

Underdog не раскрыла размер контекста для своей сборки. У базовой Qwen3.8-27B он составляет 262 144 токена нативно.

Можно ли сравнивать Saluki с Bonsai 2 напрямую?

Напрямую — нет. Каждый вендор использует собственный стенд, поэтому межвендорные результаты не сопоставимы. В общем стенде Underdog Bench (120 задач BFCL v4) Saluki набирает 88, Bonsai 2 — 70.

Что делать, если нужна максимальная точность в математике?

Использовать полную Qwen3.8-27B в BF16: на AIME 2025 она даёт 96,7 против 79,2 у Saluki. Сборка рассчитана на агентные сценарии с вызовом инструментов, а не на соревновательную математику.

Источник: marktechpost.com