Характеристики в карточках моделей обычно описывают работу на серверном железе в полной точности. Эти цифры редко предсказывают, как модель поведёт себя на смартфоне. Liquid AI представила Pipette — открытую платформу для бенчмаркинга фундаментальных моделей на граничных устройствах, созданную в партнёрстве с Artificial Analysis, которая выступила независимым валидатором методологии.
Pipette рассматривает поведение модели на устройстве как свойство развёрнутой системы, а не самой модели. Единица измерения здесь — полная конфигурация: модель + квантование + рантайм + устройство. Стартовый набор данных охватывает пять метрик производительности для более чем 1 000 конфигураций модель × квантование × рантайм × устройство × контекст, включая 30+ моделей, сборки llama.cpp для macOS, iOS, Windows и Android, а также длины контекста от 256 до 8 192 токенов. Первые проверенные результаты получены на MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra.
Что именно измеряет Pipette
В Pipette единица измерения — конфигурация развёртывания: модель + квантование + рантайм + устройство. Бенчмарк определяет метрику и форму токенов, выдавая результат по задержке, пропускной способности или памяти. Качество отслеживается отдельно на IFBench, GPQA Diamond и MATH-500.
Эти оценки качества сейчас получают из прогонов llama.cpp на эталонных системах NVIDIA H100 80GB, после чего сопоставляют с результатами на устройстве для той же модели и квантования. Число качества рядом со скоростью на телефоне было получено не на самом телефоне.
Почему контекст развёртывания меняет ответ
Четыре опубликованных сравнения показывают, насколько сильно конфигурация может повлиять на решение:
- Масштабирование контекста расходится при одинаковом числе параметров. При Q4_K_M на Galaxy S26 Ultra Granite-4.0-H-350M сохраняет 78,4% пропускной способности декодирования при росте входных токенов с 256 до 4 096, тогда как Granite-4.0-350M — только 33,8%.
- Разреженная активация ускоряет, но не экономит память. При 2 048 входных токенах на том же телефоне LFM2.5-8B-A1B декодирует в 2,4 раза быстрее Qwen3.5-4B и в 2,6 раза быстрее Ministral-3-3B-Instruct-2512. При этом активируется 1,5 из 8,5 млрд параметров на токен, но пик потребления достигает 5,29 ГиБ, потому что веса всех экспертов занимают память.
- Скорость и качество не совпадают. На iPhone 17 Pro при Q4_K_M MiniCPM5-1B выполняет нагрузку 2 048 входных / 256 выходных токенов за 3,47 секунды против 4,12 секунды у LFM2.5-1.2B-Instruct — на 15,8% быстрее. При этом LFM набирает на 9,0 балла больше в MATH-500.
- Почти идентичные системные профили скрывают развороты на уровне задач. При Q4_K_M и 2 048 входных токенах на M5 Max Granite-4.1-8B и Ministral-3-8B-Instruct-2512 различаются на 2,4% по пропускной способности декодирования и на 1,2% по пиковой RAM. Granite опережает Ministral в IFBench на 7,3 балла, а Ministral — в GPQA Diamond на 14,0 баллов.
Как устроены измерения
Прогоны производительности следуют опубликованной методологии: фиксированные формы токенов, жадное декодирование, отбрасываемый прогрев, пять повторных измерений и проверка готовности. Перед каждым замером платформенная проверка подтверждает тепловые условия и нагрузку; неудачные прогоны не публикуются.
Оценки используют отдельный протокол с детерминированной, слепой к модели проверкой, а pipette-scores никогда не видит происхождение генерации. Каждая отправка фиксирует версию бенчмарка, форму токенов, артефакт модели, квантование, версию рантайма и настройки, а также железо и ОС устройства.
Кому это нужно
Любой команде, которая выпускает модель на железо, ей не принадлежащее. Соло-разработчики и стартапы на ранней стадии могут пользоваться дашбордом и приложениями без собственной инфраструктуры. Продуктовые команды среднего размера запускают клиенты на внутреннем парке устройств. Крупные OEM-производители, чипмейкеры и предприятия могут развернуть весь конвейер за своим файрволом.
Отрасли: потребительская электроника и OEM-производители смартфонов, автомобилестроение, промышленность и робототехника, медицинские устройства, финансовые услуги, оборона — везде, где задержка, приватность или связность вынуждают выполнять инференс на устройстве.
Применения: выбор модели и квантования до начала спринта; проверка закупок SoC и железа; регрессионное тестирование при обновлении рантайма, ОС или драйверов; планирование ёмкости по длине контекста; независимая проверка заявлений вендоров о производительности.
Что вошло в релиз
Pipette поставляется как инфраструктура под лицензией Apache 2.0 (pipette-mgmt, pipette-clients, pipette-scores), публичный набор результатов, размещённый дашборд и нативные бенчмарк-приложения для iOS и Android. Ничего из этого не в списке ожидания. Публикация результатов, присланных сообществом, пока в бета-версии.
Среди устройств в стартовом наборе — MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra. Результаты для AMD Ryzen AI Max+ 395 и Radeon 8060S заявлены как «скоро».
Инструмент дополняет выпущенную Liquid AI агентную модель LFM2.5-2.6B с контекстом 128K и открытыми весами — как раз такие модели и стоит проверять на реальных устройствах. Тем, кто развивает агентные системы, пригодится и открытый Python-рантайм Shepherd для форка и отката агентных запусков.
Частые вопросы
Что такое Pipette?
Открытая платформа от Liquid AI для воспроизводимого бенчмаркинга фундаментальных моделей на граничных устройствах. Единица измерения — конфигурация развёртывания: модель + квантование + рантайм + устройство.
Чем Pipette отличается от обычных бенчмарков?
Обычные карточки моделей описывают работу на серверном железе в полной точности. Pipette измеряет поведение в реальной конфигурации развёртывания и показывает, что результат сильно зависит от связки компонентов, а не только от модели.
Какие метрики измеряет Pipette?
Пять метрик производительности на устройстве: задержка, пропускная способность, использование памяти и другие. Качество оценивается отдельно на IFBench, GPQA Diamond и MATH-500.
На каком железе получены первые результаты?
На MacBook Pro с M5 Max, iPhone 17 Pro и Galaxy S26 Ultra. Результаты для AMD Ryzen AI Max+ 395 и Radeon 8060S ожидаются позже.
Почему качество модели не измеряется прямо на телефоне?
Оценки качества сейчас выполняются на эталонных NVIDIA H100 80GB через llama.cpp, после чего сопоставляются с прогонами на устройстве для той же модели и квантования. Число качества рядом со скоростью на телефоне получено не на самом телефоне.
Можно ли использовать Pipette без собственной инфраструктуры?
Да. Соло-разработчики и стартапы могут пользоваться публичным дашбордом и нативными приложениями для iOS и Android. Для полного конвейера за своим файрволом нужна собственная инфраструктура.
Под какой лицензией выпущен Pipette?
Инфраструктура Pipette — pipette-mgmt, pipette-clients, pipette-scores — распространяется под лицензией Apache 2.0. Набор результатов и дашборд также публичны.
Кому в первую очередь полезен Pipette?
Командам, которые выпускают модели на устройства: от соло-разработчиков до OEM-производителей и чипмейкеров. Особенно актуально для отраслей, где инференс вынужденно выполняется на устройстве из-за задержки, приватности или отсутствия связи.
Источник: marktechpost.com