LiquidAI выпустила на Hugging Face две новые модели энкодеров — LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. Модели предназначены для эффективного инференса на CPU при обработке длинных последовательностей: они сопоставимы по качеству с более крупными энкодерами, но сохраняют низкую задержку по мере роста длины входа.
Модели построены на архитектуре LFM2.5. Они инициализируются из декодерных backbones LFM2.5-230M и LFM2.5-350M, после чего каузальный декодер преобразуется в двунаправленный энкодер. Для этого разработчики применили маску двунаправленного внимания (каждый токен видит токены с обеих сторон), некаузальные короткие свёртки с симметричным дополнением, чтобы каждый токен получал информацию от соседей слева и справа, и обучение с маскированием 30% токенов.
Разработчики пояснили, что энкодеры отвечают за многие современные NLP-задачи в production: классификаторы, роутеры намерений, безопасностные фильтры. Эти задачи работают круглосуточно, обычно на CPU, на всё более длинных входных данных. BERT основал этот класс моделей, ModernBERT продвинул точность и скорость, а LFM2.5-Encoders делают следующий шаг на архитектуре LFM2, где стоимость растёт медленно по мере увеличения входа.
Двухстадийное обучение
На первом этапе модели обучались на коротком контексте (1024 токена) с использованием masked-language objective на крупном веб-корпусе для выработки общей языковой компетенции. На втором этапе контекст расширялся до 8192 токенов на полной выборке с усилением фактологической, юридической и мультиязычной компетенции.
Результаты тестов
Разработчики провели полное дообучение каждой модели на 17 задачах из наборов GLUE, SuperGLUE и мультиязычной классификации. Каждый результат — среднее по пяти случайным начальным состояниям. LFM2.5-Encoder-350M занял четвёртое место среди моделей своего размера.
Производительность на CPU
По заявлению LiquidAI, на длинных контекстах LFM2.5-Encoders работают примерно в 3,7 раза быстрее ModernBERT-base. Задержка растёт медленно по мере увеличения длины входа, что делает модели пригодными для задач, обрабатывающих документы целиком. Разработчики представили живые демонстрации на странице релиза.
Применение
Разработчики позиционируют энкодеры для production-задач, работающих круглосуточно на CPU: классификаторы текста, роутеры намерений (intent routing), политики-линтеры (policy linting), детекторы PII и безопасностные фильтры. Модели могут быть дообучены как для классификации, так и для токено-уровневых задач, а также для поиска.
В отличие от выпущенных ранее LFM2.5-Retriever, предназначенных для мультиязычного поиска, новые энкодеры решают более широкий круг задач благодаря предобучению с masked-language objective. Репозиторий с фреймворком и результатами опубликован в открытом доступе.
В отличие от выпущенных ранее LFM2.5-Retriever, предназначенных для мультиязычного поиска, новые энкодеры решают более широкий круг задач благодаря предобучению с masked-language objective. Разработчики подчёркивают, что на бенчмарках было выполнено полное дообучение каждой модели на 17 задачах из GLUE, SuperGLUE и мультиязычной классификации с усреднением по пяти случайным начальным состояниям, что обеспечивает стабильность результатов. Полный фреймворк и сырые результаты опубликованы в открытом доступе на GitHub.
Источник: huggingface.co