Идея простая и симпатичная: взять крошечную базовую модель, дообучить её на «размышлениях» большой модели и получить компактную локальную LLM, которая умеет рассуждать. Именно так на базе MiniCPM5-1B от OpenBMB собрали «думающую» модель, которая в самом лёгком квантовании весит всего 657 МБ.
Что за модель
Основа — MiniCPM5-1B, плотная модель на 1,08 млрд параметров со стандартной архитектурой LlamaForCausalLM: 24 слоя, grouped-query attention и контекст до 128K токенов. Самая маленькая квантованная версия (Q4_K_M) занимает около 657 МБ — это спокойно помещается на обычное локальное железо. Есть варианты и тяжелее: Q5_K_M — примерно 751 МБ, F16 — около 2,1 ГБ. Запускается без облака и API-ключей: через llama.cpp, Ollama, LM Studio, jan и KoboldCpp.
Как дообучали
Здесь не классическая дистилляция на уровне весов, а обычное supervised-дообучение на трейсах Claude Fable 5. Схема такая: модель-учитель генерирует диалоги, её ответы и цепочки рассуждений сохраняют как текст, а затем на этом материале дообучают маленькую базовую модель. Родной шаблон размышлений и формат вызова инструментов от MiniCPM5 при этом сохраняются.
Чего ждать не стоит
Авторы честно предупреждают о границах подхода: дообучение на выходах переносит формат и стиль, но не передаёт ни передовые способности к рассуждению, ни широкие знания. Причём проверить заявления пока нельзя — ни бенчмарков, ни обучающего датасета публично не выложили, так что оценки возможностей остаются на веру.