TwIL-LM: модели 1.7B и 3B для формальной логики и Lean на локальном железе

Компания webAI представила TwIL-LM — семейство из двух моделей формальной логики с параметрами 1.7B и 3B. Модели предназначены для автоформализации: перевода английских утверждений на язык логики первого порядка и проверки, следует ли вывод из посылок. Обе модели работают локально: квантованная сборка 1.7B занимает 1.06 ГБ, а 3B-версия в формате Q4_K_M GGUF — 1.78 GiB и запускается на CPU или GPU с 4 ГБ видеопамяти. В отличие от крупных агентных моделей, рассчитанных на работу в периметре, TwIL-LM делает ставку на компактность и формальную точность.

Что умеют модели

TwIL-LM3 (3B) — это merged fine-tune на базе SmolLM3-3B, а версия 1.7B — PEFT LoRA-адаптер для SmolLM2-1.7B-Instruct. Области применения включают:

  • перевод текста на естественном языке в логику первого порядка;
  • классификацию следствий по множеству посылок;
  • преобразование естественного языка в структурированные запросы;
  • составление и критику формализаций в Lean;
  • проверку выводов более крупных моделей через верификатор.

webAI позиционирует локальное выполнение для сред, где данные не могут покидать устройство: комплаенс и RegTech, финансовые услуги, здравоохранение и фармацевтика, юридические операции и исследования формальных методов.

Как обучали TwIL-LM3

Обучение прошло в четыре этапа поверх базовой модели. Сначала — LoRA-дообучение на синтетическом корпусе формальной логики. Затем — слияние чекпоинтов с усреднением промежуточных SFT-состояний в пространстве параметров. Далее — WiSE-FT интерполяция назад к предобученной базе с λ = 0.25. Финальный этап — MGPO, энтропийно-взвешенная стадия GRPO с программным верификатором. Опубликованный чекпоинт — шаг 2071.

Значение λ критично: сохраняется только четверть дельты дообучения. Ветка без интерполяции показала лучший результат внутри домена (макро-гейт 0.515), но потеряла около двенадцати пунктов на held-out тестах. Эту ветку webAI не публиковала.

Результаты тестов

В анонсе webAI приводит следующие показатели: 96.4 на индукции правил, 87.6 на семантическом парсинге, 64.6 на формализации в Lean, 52.0 на ответах в точном формате и 68.7 на разметке следствий.

На Track A (внутридоменная формальная логика) TwIL-LM3 набирает 0.4488 по среднему шести дорожек и 0.4218 по макро-гейту — метрике, на которую ориентирован процесс обучения. Модель превосходит все ветки вплоть до LFM2.5-8B-A1B по всем шести объективным дорожкам: 0.4218 против 0.3757 при трети параметров. Однако две самые крупные модели её опережают: Qwen3-8B берёт гейт 0.5336 против 0.4218, но большая часть — за счёт нестрогого совпадения; при строгой оценке strict-7 разрыв сокращается до 0.2093 против 0.1971. gpt-oss-120b опережает по среднему шести дорожек: 0.5192 против 0.4488.

Главное преимущество TwIL-LM3 — эффективность. Модель генерирует кратчайшие ответы среди всех веток — 482 токена на Track B — и выдаёт 32.9 ответов в секунду против 4.2 у 120B-модели. Это выгодно отличает её от тяжёлых открытых моделей, которым для работы нужны десятки гигабайт видеопамяти.

Перенос на новые данные

TwIL-LM3 улучшает внутридоменные показатели на +26% относительно (макро-гейт 0.336 → 0.422) и одновременно прибавляет +0.022 по среднему held-out. По данным модели, это единственная ветка проекта, которая растёт по обоим трекам. LogicBench поднимается до 0.7167 с 0.6467, GSM8K незначительно снижается до 0.8733 с 0.8833, IFEval регрессирует до 0.6433 с 0.6767.

Версия 1.7B — другой компромисс: макро-основной балл 0.361 против 0.185 у неадаптированной базы. Результаты вне распределения смешанные: LogicBench BQA улучшается до 0.590 с 0.563, но GSM8K падает до 0.380 с 0.413, а ARC-C с цепочкой рассуждений — до 0.463 с 0.587.

Лицензия и ограничения

Обе модели распространяются под webAI Non-Commercial License ver. 1.0. Использование только в некоммерческих целях; развёртывание, приносящее доход, требует отдельного соглашения с webAI. Для компаний любого размера это означает: протестировать модели локально можно, но для продакшена с монетизацией придётся договариваться с вендором. Как и открытые модели Mistral, TwIL-LM доступна для изучения, но с существенными ограничениями на коммерческое применение.

Частые вопросы

Можно ли использовать TwIL-LM в коммерческом проекте?

Нет, если проект приносит доход. Обе модели выпущены под некоммерческой лицензией webAI Non-Commercial License ver. 1.0. Для коммерческого использования нужно отдельное соглашение с webAI.

Какое оборудование нужно для запуска?

Версия 3B в формате Q4_K_M GGUF занимает 1.78 GiB и работает на CPU или GPU с 4 ГБ видеопамяти. Версия 1.7B в квантованном виде — 1.06 ГБ. Обе модели запускаются локально.

Чем TwIL-LM отличается от обычных LLM?

Модели специализированы на формальной логике: переводе утверждений в логику первого порядка, проверке следствий и работе с Lean. Это не универсальные чат-модели, а инструменты для задач верификации и формализации.

Что такое автоформализация?

Это перевод утверждений с естественного языка на формальный язык — например, логику первого порядка или язык доказательств Lean. TwIL-LM также умеет проверять, следует ли вывод из заданных посылок.

Насколько TwIL-LM3 уступает gpt-oss-120b?

По среднему шести дорожек внутридоменных тестов — 0.4488 против 0.5192. Но TwIL-LM3 в разы эффективнее: 32.9 ответов в секунду против 4.2 при генерации в 482 токена.

Что такое WiSE-FT и зачем он нужен?

WiSE-FT — интерполяция весов между дообученной и исходной моделью. В TwIL-LM3 она применена с λ = 0.25: сохраняется только четверть дельты дообучения, что защищает от потери способностей на данных вне обучающего распределения.

Подходит ли TwIL-LM для проверки выводов других моделей?

Да, это одна из заявленных областей применения: модель может выступать верификатором, проверяющим выводы более крупной модели. Это особенно полезно для задач, где нужна формальная корректность рассуждений.

Источник: marktechpost.com