Liquid AI выпустила LFM2.5-2.6B: ИИ-агенты на ноутбуке и телефоне без облачного билла

Liquid AI представила LFM2.5-2.6B — модель, созданную для запуска полноценных ИИ-агентов прямо на устройстве. Она поддерживает вызов инструментов и многошаговые сценарии, оставаясь достаточно компактной для обычного железа — от ноутбуков до телефонов. По замыслу авторов, это позволяет разворачивать агентов где угодно, не отправлять данные в облако и не платить за облачный инференс.

Что показывает модель

По заявлениям Liquid AI, на задачах работы с инструментами, следования инструкциям и многошаговых агентских сценариях модель конкурирует с решениями вчетверо крупнее. Она обучалась на ~34 трлн токенов, а промежуточный этап расширил контекст до 128K. Пост-обучение проходит в четыре стадии: два раунда supervised fine-tuning с упором на агентские данные, специализация учителей по доменам (математика, код, инструменты), дистилляция учителей в одну студенческую модель и агентское reinforcement learning в реальных агентских харнессах.

На бенчмарках LFM2.5-2.6B обходит всех соперников в следовании инструкциям (IFBench 59,17, Multi-IF 80,07, IFStruct 85,49) и почти все — в работе с инструментами: хуже неё только Qwen3.5-9B в BFCLv4. В агентских задачах она обгоняет обе модели Gemma и идёт вровень с Qwen. Кодинг — единственное направление, где крупные модели сохраняют заметное преимущество, так что для него стоит брать модель побольше.

Скорость

Инференс — сильная сторона модели: 220 токенов в секунду на Apple M5 Max и 113 токенов в секунду на AMD Ryzen AI Max+ 395, при этом модели хватает менее 2,5 ГБ памяти. На скорости 30 токенов в секунду агента можно держать даже на телефоне. На GPU это самая быстрая модель в своём классе: почти 15 тысяч выходных токенов в секунду при высокой конкурентности, то есть примерно 1,3 млрд токенов в день на одной H100. Поддержка инференса заявлена с первого дня в llama.cpp, MLX, vLLM, SGLang и ONNX.

Как запустить

Нужен transformers версии 5.0.0 или новее:

pip install -U transformers

Затем модель загружается стандартно:

from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="bfloat16")
tokenizer = AutoTokenizer.from_pretrained(model_id)

И LFM2.5-2.6B, и базовая LFM2.5-2.6B-Base уже доступны на Hugging Face; есть браузерное WebGPU-демо и гайды по запуску локальных агентов — OpenClaw, Hermes Agent, Pi.

Для компаний, которым не хочется гонять корпоративные данные через облачные API, локальная модель с агентскими возможностями — заметный аргумент: данные остаются на устройстве, а инференс не привязан к контракту с облаком.

Источник: huggingface.co