MiniCPM5-1B дообучили на трейсах Claude Fable 5 — получилась «думающая» модель на 657 МБ

Идея простая и симпатичная: взять крошечную базовую модель, дообучить её на «размышлениях» большой модели и получить компактную локальную LLM, которая умеет рассуждать. Именно так на базе MiniCPM5-1B от OpenBMB собрали «думающую» модель, которая в самом лёгком квантовании весит всего 657 МБ.

Что за модель

Основа — MiniCPM5-1B, плотная модель на 1,08 млрд параметров со стандартной архитектурой LlamaForCausalLM: 24 слоя, grouped-query attention и контекст до 128K токенов. Самая маленькая квантованная версия (Q4_K_M) занимает около 657 МБ — это спокойно помещается на обычное локальное железо. Есть варианты и тяжелее: Q5_K_M — примерно 751 МБ, F16 — около 2,1 ГБ. Запускается без облака и API-ключей: через llama.cpp, Ollama, LM Studio, jan и KoboldCpp.

Как дообучали

Здесь не классическая дистилляция на уровне весов, а обычное supervised-дообучение на трейсах Claude Fable 5. Схема такая: модель-учитель генерирует диалоги, её ответы и цепочки рассуждений сохраняют как текст, а затем на этом материале дообучают маленькую базовую модель. Родной шаблон размышлений и формат вызова инструментов от MiniCPM5 при этом сохраняются.

Чего ждать не стоит

Авторы честно предупреждают о границах подхода: дообучение на выходах переносит формат и стиль, но не передаёт ни передовые способности к рассуждению, ни широкие знания. Причём проверить заявления пока нельзя — ни бенчмарков, ни обучающего датасета публично не выложили, так что оценки возможностей остаются на веру.