Liquid AI выпустила LFM2.5-2.6B — агентную модель для работы на устройстве с контекстом 128K и открытыми весами

Liquid AI выпустила LFM2.5-2.6B — агентную модель, которая полностью работает на устройстве: планирует, вызывает инструменты и решает многошаговые задачи на телефонах, ноутбуках, ПК и роботах. У модели 2,69 млрд параметров, контекстное окно на 131 072 токена и словарь на 128 000 токенов; предобучение заняло примерно 34 триллиона токенов.

Вышло два чекпоинта: LFM2.5-2.6B-Base для дообучения и LFM2.5-2.6B, пост-обученная для агентных нагрузок. Поскольку инференс остаётся локальным, данные не покидают устройство, а предельные затраты на каждый запуск близки к нулю. По заявлению Liquid AI, показатели tool-use и следования инструкциям конкурируют с моделями почти вчетверо большего размера.

Развёртывание: от телефона до GPU

Оба чекпоинта опубликованы на Hugging Face под лицензией lfm1.0. Веса доступны в нативных форматах, а также GGUF, MLX и ONNX, с поддержкой с первого дня в llama.cpp, vLLM, SGLang и LM Studio.

Производительность: на чипе M5 Max модель декодирует 220 токенов/с, укладываясь в 2,5 ГБ памяти; на телефоне — около 30 токенов/с. Один сервер с NVIDIA H100 SXM5 обслуживает примерно 1,3 млрд токенов в день. Дообучение возможно через LoRA с библиотеками TRL и Unsloth.

Liquid AI адресует модель автомобильной отрасли, бытовой электронике, промышленной робототехнике, здравоохранению, финансовым услугам, электронной коммерции и обороне. Наибольшую выгоду получат регулируемые и изолированные от сети среды: ни один промпт не уходит в сторонний API. Рекомендуемые сценарии — агентные нагрузки, использование инструментов, извлечение данных, RAG и длинноконтекстные задачи: офлайн-ассистенты, разбор документов на входе до 128K токенов, извлечение данных из форм и счетов, командный парсинг для роботов, фоновые агенты без оплаты за каждый токен. Для агентного кодинга и задач, насыщенных знаниями, модель использовать не рекомендуют.

Архитектура и пост-обучение

LFM2.5-2.6B построена на 30 слоях: 22 блока двойных short-convolution и 8 блоков grouped-query attention. Словарь 128 000 токенов, контекст 131 072 токена, обучение на примерно 34 триллионах токенов. Словарь удвоили, расширив существующий токенизатор без переобучения с нуля, а отдельный этап mid-training расширяет контекст до 128K. Модель покрывает 16 языков и работает только с текстом.

Превращение базового чекпоинта в агента проходит четыре этапа. Сначала два последовательных раунда supervised fine-tuning — смесь для SFT примерно в семь раз больше той, что использовалась для LFM2.5-8B-A1B. Затем специализация «учителей»: по одному эксперту на домен, обученному подкреплением с проверяемыми наградами. Далее — многодоменная дистилляция по собственной политике: студент генерирует траектории, а каждый промпт направляется к доменному «учителю». И наконец, агентное подкрепление через GRPO в реальных средах, включая Hermes Agent и OpenClaw.

Бенчмарки

Liquid AI сравнивала LFM2.5-2.6B с gemma-4-E2B-it (5,1 млрд параметров), gemma-4-E4B-it (8 млрд), Qwen3.5-4B (4,7 млрд) и Qwen3.5-9B (9,7 млрд). На ToolSandbox модель набирает 77,83 против 65,00 у gemma-4-E4B-it и 76,44 у Qwen3.5-9B; Multi-IF — 80,07; IFStruct — 85,49; IFBench — 59,17; BFCLv4 — 56,88, уступая Qwen3.5-9B (60,13). Модель лидирует во всех опубликованных бенчмарках следования инструкциям и почти во всех бенчмарках использования инструментов. Кодинг остаётся за более крупными моделями: LiveCodeBenchv6 показывает 59,41 против 69,86 у Qwen3.5-9B.

Открытые веса и полный локальный запуск означают, что модель можно развернуть без обращения к сторонним API — для команд, которым важно не отправлять данные наружу, это принципиальное преимущество, а для средних команд достаточно одного GPU для самостоятельного хостинга.

Источник: marktechpost.com