Liquid AI выложила на Hugging Face две открытые мультимодальные модели семейства d1 — d1-3B и d1-omni-600M. Это не чат-модели: они не генерируют текст, а за один прямой проход возвращают калиброванные типизированные ответы. Счётчик выходных токенов у них всегда равен нулю. Целевая платформа — стек NVIDIA: серверы DGX, рабочие станции RTX и платы Jetson. Подход перекликается с другими открытыми релизами для локального инференса, например с маршрутизатором NVIDIA PAIR между RTX, DGX Spark и Mac.
Что такое decision-модель
Обычная генеративная LLM пишет ответ токен за токеном, а ваш код потом разбирает этот текст. Decision-модель устроена иначе: она принимает состояние (state) и набор именованных вопросов, читает их один раз и возвращает вероятность для каждого допустимого ответа.
Liquid AI определяет три типа вопросов:
- noul — вопрос «да/нет», возвращается P(yes);
- choice — одна метка из именованных вариантов с полным распределением вероятностей;
- score — взвешенная по вероятностям позиция на упорядоченной шкале из 2–10 уровней.
Несколько вопросов могут делить одно состояние в рамках одного вызова. Каждый ответ сообщает output_tokens: 0. Вендор рекомендует d1 для маршрутизации, модерации, классификации интентов, реранжирования, оценки по схеме LLM-as-a-judge, ограничителей (guardrails) агентов и визуального контроля.
Как устроены d1-3B и d1-omni-600M
d1-3B содержит 3,12 млрд параметров и отталкивается от LFM2.5-VL-3B — декодерной vision-language модели. Liquid AI усреднила веса LFM2.5-2.6B с текстовым бэкбоном этой модели, затем дообучила несколько чекпойнтов с разными seed и смесями данных и снова их объединила. Используется 400M-энкодер SigLIP2 NaFlex и контекст 32 768 токенов. По словам разработчиков, длинные входы, перемешанные варианты ответов и исправление коротких путей в данных дали больше, чем продвинутые техники.
d1-omni-600M содержит 587 млн параметров и построена на LFM2.5-Encoder-350M — двунаправленном энкодере. Внутри: 381M общий ствол с решающей головой, 94M визуальный энкодер и 112M аудиоэнкодер. Аудиоэнкодер — 17-слойный FastConformer. Контекст — 16 384 токена, аудиоклипы ограничены 30 секундами. Один запрос несёт либо изображение, либо аудио, но никогда оба сразу. Аудио обучалось только на английских запросах «говорящий → ассистент».
Где Open d1 пригодится
- Триаж обращений и поддержка. Один вызов d1-3B по одному и тому же сообщению отвечает на вопрос о возврате (да/нет), выбирает ответственную команду и оценивает срочность — при нуле выходных токенов на разбор.
- Визуальный контроль и модерация на периферии. d1-3B читает изображение 384 px за 35 мс на Jetson AGX Thor, а демо Open d1 Arcade прогоняет её кадр за кадром на живом видеопотоке для модерации контента и управления жестами.
- Маршрутизация голосовых команд на малых устройствах. d1-omni-600M принимает до 30 секунд речи вместе с текстом и сразу возвращает интент или тему говорящего. В карточке модели среди рекомендуемых применений указаны маршрутизация голосовых команд и guardrails агентов.
Результаты на бенчмарках
На Decision Index v0.2.1 d1-3B набирает 48,57 — это лучший результат среди моделей до 10B, и он немного выше Decider 35B-A3B (47,11). Выше только Winnow-12B с 50,02. Официальный скорер запускала сама Liquid AI, так что оценки d1 — не заявки на лидерборд. d1-3B лидирует в категориях Tools (74,5) и Arts (36,3), но отстаёт в Knowledge (23,8).
На семи публичных текстовых бенчмарках d1-3B в среднем даёт 82,9 против 81,1 у Decider 4B. d1-omni-600M показывает в среднем 78,4 и лучшие результаты в Civil Comments (95,8) и PAWS-X (79,5). На 11 графических бенчмарках d1-3B в среднем 74,1 против 73,9 у базовой модели. Аудио-бенчмарки для decision-моделей Liquid AI называет открытой проблемой.
Скорость на оборудовании NVIDIA
Liquid AI измеряла сквозную задержку на одном «прогретом» запросе за раз. Один вопрос занимает 8 мс на RTX 4090 и 9 мс на AMD MI325X. На Jetson: AGX Thor — 16 мс, AGX Orin — 26 мс, Orin Nano — 50 мс. На Jetson AGX Thor три вопроса по одному состоянию занимают 20 мс против 16 мс для одного. Показатель RTX 4090 получен с model.compile(mode="reduce-overhead"); без него один вопрос занимает 16 мс. Руководства по d1-3B также размещены в Jetson AI Lab от NVIDIA.
Сравнение с другими открытыми decision-моделями
| Модель | Параметры | База | Входы | Контекст | Decision Index v0.2.1 | Лицензия |
|---|---|---|---|---|---|---|
| d1-3B | 3,12B | LFM2.5-VL-3B | текст, изображения | 32 768 | 48,57 | LFM Open v1.0 |
| d1-omni-600M | 587M | LFM2.5-Encoder-350M | текст + изображение или текст + аудио | 16 384 | 15,95 | LFM Open v1.0 |
| Decider 4B | 4,2B | Qwen3.5-4B-Base | текст | 32K-состояние | 40,70 | Apache 2.0 |
| Decider 35B-A3B | 34,7B всего, 3B активных | Qwen3.5-35B-A3B-Base | текст | 32K-состояние | 47,11 | Apache 2.0 |
| Winnow-12B | 12B | Gemma 4 12B IT | текст, изображения | 65 536 (тест Q8) | 50,02 | Apache 2.0 |
Задержки в таблице измерены на разном оборудовании и разных нагрузках, поэтому напрямую их сравнивать нельзя.
Как запустить d1 локально
Оба чекпойнта лежат на Hugging Face, загружаются через Transformers и получили поддержку llama.cpp в день релиза. Лицензия LFM Open License v1.0 разрешает бесплатное коммерческое использование при годовом доходе ниже $10 млн. По духу это близко к другим открытым моделям для локального запуска, вроде Julia 1 от Supersonic Labs, которая работает на CPU.
Для d1-3B нужны transformers>=5.14 и trust_remote_code=True, для d1-omni-600M — transformers>=5.15. Обе модели предоставляют system_one(state, questions) для одного состояния и system_one_batch для упакованных запросов. Для d1-omni-600M на GPU Liquid AI рекомендует float16: bfloat16 менял некоторые верхние ответы. В пространстве Open d1 Arcade доступны десять демо d1-3B с камерой. Совместно с NVIDIA Liquid AI показала, как d1-3B управляет Isaac Sim с Jetson.
d1-omni-600M — ранний исследовательский релиз, опубликованных данных о задержке у него нет.
Частые вопросы
d1 — это чат-модель?
Нет. Ни один чекпойнт не является чат-моделью: они не генерируют текст, а возвращают вероятность для каждого допустимого ответа за один прямой проход.
Кого касается этот релиз?
Разработчиков и администраторов, которым нужны быстрые решения на периферии: триаж обращений, модерация, маршрутизация голосовых команд, визуальный контроль и guardrails агентов на оборудовании NVIDIA — от RTX до Jetson.
Можно ли использовать d1 в коммерческом продукте?
Да, лицензия LFM Open License v1.0 допускает бесплатное коммерческое использование, если годовой доход компании ниже $10 млн.
Что нужно для локального запуска d1-3B?
Версия transformers>=5.14, флаг trust_remote_code=True и вызов system_one(state, questions) для одного состояния либо system_one_batch для упакованных запросов.
Чем отличаются входы d1-3B и d1-omni-600M?
d1-3B читает текст и изображения. d1-omni-600M принимает текст с изображением либо текст с аудио, но один запрос никогда не несёт и то, и другое.
Как быстро d1-3B отвечает на одном вопросе?
8 мс на RTX 4090 (с model.compile(mode="reduce-overhead"); без него — 16 мс), 9 мс на AMD MI325X, 16 мс на Jetson AGX Thor, 26 мс на AGX Orin и 50 мс на Orin Nano.
Есть ли у d1-omni-600M данные о задержке?
Нет. Это ранний исследовательский релиз, опубликованных цифр по латентности у него нет.
Как d1-3B выглядит на фоне других decision-моделей?
На Decision Index v0.2.1 у неё 48,57 — лучший результат среди моделей до 10B и чуть выше Decider 35B-A3B (47,11); выше только Winnow-12B (50,02). Оценки получены официальным скорером, запущенным самой Liquid AI.
Поддерживается ли d1 в llama.cpp?
Да, оба чекпойнта получили поддержку llama.cpp в день релиза и загружаются через Transformers.
Как d1 соотносится с другими открытыми моделями решений?
Среди открытых моделей решений d1-3B уступает только Winnow-12B по Decision Index v0.2.1, а по лицензии LFM Open v1.0 коммерческое использование бесплатно при доходе ниже $10 млн — в отличие от Apache 2.0 у Decider и Winnow.
Источник: marktechpost.com