ThinkingCap-Qwen3.8-27B: на 37,2% меньше токенов рассуждения ценой 0,86 п.п. точности

BottleCap AI выпустила ThinkingCap-Qwen3.8-27B — вторую модель в серии ThinkingCap. Это дообучение (fine-tune) модели Qwen3.8-27B от команды Qwen с одной узкой целью: сократить цепочки рассуждения. На 12 бенчмарках модель тратит в среднем на 37,2% меньше токенов рассуждения, а макро-точность снижается с 86,65% до 85,79%, то есть на 0,86 процентного пункта.

Что именно сократили

Идея BottleCap в том, что модели рассуждения нередко тратят на размышление больше токенов, чем требует вопрос, и многие из этих лишних токенов не меняют итоговый ответ. Первый релиз серии применял тот же подход к Qwen3.6-27B.

На этот раз задачу поставили намеренно консервативно: не добавлять знаний и не менять стиль ответов. Способность рассуждать, следование инструкциям и безопасное поведение должны были остаться нетронутыми. Дополнительный акцент исследователи сделали на математике, рассуждениях, длинном контексте и агентных задачах.

Результаты бенчмарков при reasoning_effort=xhigh

Все основные числа получены при reasoning_effort=xhigh — значении по умолчанию в шаблоне чата. Сокращение токенов наблюдается на каждом бенчмарке и составляет от 10,7% до 65,5%.

Сильнее всего ужимаются задачи на знания и многоязычность. MMMLU сокращается на 65,5% (с 1656 до 571 токена), MMLU-Pro — на 57,3%. GPQA-Diamond падает с 12 772 до 7267 токенов, это 43,1%. IFBench думает на 46,4% меньше при почти неизменной точности (с 79,75% до 79,71%).

Извлечение из длинного контекста даже улучшается: точность AA-LCR растёт на 2,25 п.п., с 81,75% до 84,00%, при этом токенов рассуждения на 38,6% меньше. LiveCodeBench v6 прибавляет 0,07 п.п., думая на 20,3% меньше.

Агентные результаты держатся близко к базовой модели. τ²-bench теряет 1,01 п.п. за сокращение на 30,9%. Terminal-Bench 2.1 теряет 0,56 п.п. — это внутри его интервала ±4,26 — за сокращение на 10,7%.

Самая дорогая сделка — AIME 2026: точность падает на 3,85 п.п., с 98,13% до 94,27%, в обмен на 30,2% меньше токенов рассуждения.

Важно понимать, что 37,2% — это среднее по 12 отдельным сокращениям. Объединённое среднее число токенов рассуждения падает с 15 735 до 12 144.

BottleCap приводит и кривую по бюджету токенов. При ограничении в 16K токенов на ответ ThinkingCap набирает больше очков, чем базовая модель: доля усечённых цепочек падает с 0,51% до 0,34%, а зацикливаний — с 0,06% до 0,05%.

Как это сочетается с регулятором усилия

Qwen3.8-27B умеет выставлять уровень усилия рассуждения (reasoning effort), и сжатие складывается с ним. Все дельты ниже считаются относительно базовой модели при xhigh и усреднены по 11 бенчмаркам.

При medium базовая модель сокращает 52,1% размышления за −9,16 п.п., ThinkingCap — 60,2% за −9,90 п.п. При low показатели такие: −55,4% и −9,71 п.п. у базовой модели против −62,3% и −10,79 п.п. у ThinkingCap. С полностью отключённым размышлением ThinkingCap отстаёт от базы на 5,7 п.п.

Команда BottleCap рекомендует xhigh как лучший баланс точности и токенов. Отдельным режимам размышления обещают уделить внимание в будущем релизе.

Как проводили оценку

Обе модели прогоняли через один и тот же стенд на одном NVIDIA H200 с vLLM 0.29.0. Сэмплирование было идентичным: temperature 1.0, top_p 0.95, top_k 20, min_p 0.0. Многосидовая точность — это среднее с 95-процентным интервалом. Число сидов варьируется от 32 на AIME 2026 до 1 на MMLU-Pro и MMMLU. MMMLU использует фиксированную выборку в 10 000 вопросов, остальные 11 бенчмарков прогоняются полностью.

Спекулятивное декодирование MTP (3 черновых токена) на AIME 2026 измерили как нейтральное по точности: принято 53% черновых токенов, около 2,6 токена на шаг — столько же, сколько у базовой модели.

Развёртывание: сборки, сервинг и лицензия

Контрольная точка bf16 содержит 28B параметров и принимает изображения и текст.

BottleCap публикует 5 квантованных сборок:

  • FP8: 31 ГБ, vLLM, Hopper и Blackwell.
  • NVFP4 weight-only: 21 ГБ, vLLM, Hopper (ядро Marlin) и Blackwell.
  • NVFP4 W4A4 (AWQ): 23 ГБ, только Blackwell.
  • GGUF: от 16 до 55 ГБ, для llama.cpp, LM Studio и Ollama.
  • MLX 4-bit DWQ: 21 ГБ, для Apple Silicon Mac с 32 ГБ.

Для сервинга используется рецепт базовой модели: --reasoning-parser qwen3 вместе с парсером вызова инструментов qwen3_xml на vLLM. Размышление возвращается в отдельном поле reasoning.

Лицензия — PolyForm Small Business 1.0.0 плюс персональный грант от BottleCap. Материалы Qwen выше по стеку остаются под Apache-2.0. На Hugging Face пока не указан ни один провайдер инференса, размещающий эту модель.

Если вы уже держите Qwen3.8-27B на vLLM или SGLang, замена сводится к подмене весов: сэмплирование и флаги те же. Обратите внимание на ограничение лицензии: коммерческое использование сверх малому бизнесу требует отдельного соглашения с BottleCap, а веса выдаются по запросу (gated repo).

Похожие компромиссы между размером и качеством в открытых моделях встречаются всё чаще: например, Ternary Bonsai 2 27B ужимает Qwen3.8 27B до 5,93 ГБ при 98,2% качества. А на стороне Alibaba линейка Qwen продолжается — вышла Qwen3.8-Flash-Next, 125B-модель с 6B активных параметров.

Частые вопросы

Кого касается этот релиз?

Тех, кто уже разворачивает Qwen3.8-27B локально или в облаке на vLLM или SGLang и платит за токены рассуждения. Модель задумана как прямая замена с теми же флагами и тем же сэмплированием.

Насколько падает качество?

Макро-точность снижается с 86,65% до 85,79% — на 0,86 п.п. Разброс по бенчмаркам большой: AA-LCR прибавляет 2,25 п.п., а AIME 2026 теряет 3,85 п.п.

Что такое 37,2%?

Это среднее по 12 отдельным сокращениям токенов рассуждения, а не общее сокращение. Объединённое среднее число токенов падает с 15 735 до 12 144.

Какие сборки доступны и сколько они весят?

Пять вариантов: FP8 на 31 ГБ, NVFP4 weight-only на 21 ГБ, NVFP4 W4A4 (AWQ) на 23 ГБ, GGUF от 16 до 55 ГБ и MLX 4-bit DWQ на 21 ГБ. Полная bf16-версия — 28B параметров.

Можно ли запустить на Apple Silicon?

Да, для этого есть сборка MLX 4-bit DWQ объёмом 21 ГБ — она рассчитана на Mac с 32 ГБ памяти.

Какой уровень усилия рассуждения выбрать?

Команда BottleCap рекомендует xhigh как лучший баланс точности и токенов. При medium и low экономия токенов больше, но и потеря точности растёт.

Можно ли использовать модель в коммерческом продукте?

Лицензия PolyForm Small Business 1.0.0 покрывает малый бизнес и персональное использование. Для коммерческого применения сверх этого нужен отдельный договор с BottleCap, а сами веса выдаются по запросу.

На чём измеряли?

Обе модели прогоняли на одном NVIDIA H200 через vLLM 0.29.0 с одинаковым сэмплированием: temperature 1.0, top_p 0.95, top_k 20, min_p 0.0. Многосидовые результаты усреднены с 95-процентным интервалом.

Источник: marktechpost.com