Cloudflare представила Clef и Clef-flash — первые модели, обученные командой Workers AI. Это не чат-боты, а decision-модели: на вход они получают состояние и схему типизированных вопросов, на выходе дают вероятность для каждого допустимого ответа, без свободного текста. Обе модели открыты под лицензией Apache 2.0 и совместимы с API Jev от TypeSafe AI.
Развёртывание доступно уже сейчас: модели работают на Workers AI, а веса выложены на Hugging Face для самостоятельного хостинга.
Чем decision-модель отличается от LLM
Обычная LLM генерирует токены по одному, и её вывод ещё нужно разбирать парсером. Decision-модель отвечает только на фиксированный набор вопросов о входных данных. Clef поддерживает три типа вопросов:
noul— да/нет, возвращает вероятность «да»;choice— выбор одного именованного варианта с вероятностями по каждому и значением уверенности;score— оценка по упорядоченной шкале, возвращает взвешенный по вероятностям балл.
На Workers AI один запрос может нести до 64 вопросов и до 4 изображений.
TypeSafe AI запустила Jev, свою первую модель «System One», 15 сентября 2026 года. Затем появились открытые альтернативы Kev-9B и Laya. Clef использует тот же API System One: переход с Jev означает смену endpoint и имени модели.
Как устроена Clef
Clef дообучена на базе Qwen3.8-27B, Clef-flash — на Qwen3.5-9B. Обе сохраняют vision-энкодер исходного бэкбона.
Инференс проходит в два этапа. Сначала бэкбон выполняет единственный проход prefill-only по состоянию и вопросам. Затем небольшой трансформер — joint schema head — читает финальные скрытые состояния: он направляет свидетельства к каждому вопросу, позволяет полям cross-attend и совместно оценивает все варианты. Softmax по каждому вопросу превращает логиты в вероятности.
При обучении оба бэкбона заморожены, а routing head оптимизируется совместно с low-rank адаптерами ранга 256. Функция потерь сочетает label-smoothed cross-entropy с Brier loss для калибровки. Дополнительная цель — Reinforcement Learning for Calibrated Decisions (RLCD) — даёт частичный кредит за соседние порядковые варианты.
Бенчмарки: где Clef выигрывает, а где нет
На коротком списке Cloudflare из 10 бенчмарков набора Decision Index 0.2.1 модель Clef показала лучший результат в 7 случаях:
- BANKING77 (macro-F1): Clef 94.20 против Jev 79.74;
- CLINC150+OOS (macro-F1): Clef 97.43 против Jev 89.27;
- Home appliances (case exact): Clef-flash 97.73 против Jev 52.27.
В других тестах Jev сохраняет явное лидерство. Полная карточка модели показывает преимущество Jev на GPQA Diamond (78.3 против 48.0), MMLU-Pro (82.7 против 65.9) и BBH (92.9 против 73.7).
На собственных workflow-тестах TypeSafe Clef обошла Jev в 3 из 4 областей с небольшим отрывом: обработка счетов — 64.7 против 61.8, клиентский сервис — 76.3 против 76.0, инциденты безопасности — 62.9 против 61.7. Jev лидирует в observability трассировок агентов: 71.6 против 68.5.
В сценарии threat intelligence от Cloudflare Clef классифицировала домен за 2.2 секунды, тогда как gpt-oss-120b потратила 4.7 секунды.
Все числа заявлены вендором, независимой проверки пока нет.
Сравнение характеристик
| Параметр | Clef | Clef-flash | Jev | Kev-9B | Laya |
|---|---|---|---|---|---|
| Разработчик | Cloudflare | Cloudflare | TypeSafe AI | Jared Palmer | Convai Innovations |
| Размер | 27B | 9B | не раскрыт | 9B + 45.4M LoRA | 421M |
| Бэкбон | Qwen3.8-27B | Qwen3.5-9B | не раскрыт | Qwen3.5-9B-Base | ModernBERT-large |
| Веса | Apache 2.0 | Apache 2.0 | hosted API | Apache 2.0 | Apache 2.0 |
| Ввод изображений | да | да | нет | нет | нет |
| Контекст | 65 536 | 65 536 | 32K (по данным Cloudflare) | 65 536 (8192 проверено) | 512 (английский) |
| Медианная задержка* | 209.3 мс | 38.8 мс | 524.1 мс | 51.4 мс | 5.8 мс |
| Цена хостинга (вход) | $0.24/M | $0.09/M | $0.042/M | self-host | self-host |
*Внутренний прогон Decision Index от Cloudflare. Все пять моделей реализуют API System One.
Развёртывание и дообучение
Обе модели вызываются через биндинг Workers AI (env.AI.run()), REST API или AI Gateway. Для самостоятельного хостинга карточки моделей упоминают тестирование на одной H200 с весами BF16.
Cloudflare также анонсировала сервис reinforcement learning для настройки Clef на приватных данных. Он стартует с forward-deployed инженеров Cloudflare, а self-serve платформа появится позже. Пайплайн объединяет AI Gateway, Workers AI, Containers и новый компонент Trainer. Команды могут подать заявку через форму design partner.
Для администратора, который выбирает модель для маршрутизации агентов, практическая разница такая: Clef и Clef-flash не требуют парсинга вывода и возвращают калиброванные вероятности по фиксированной схеме, что упрощает интеграцию. Но на задачах, требующих широких знаний — GPQA Diamond, MMLU-Pro, BBH — они уступают Jev, так что для сложных рассуждений decision-модель не замена универсальной LLM. Если же нужна именно компактная модель на CPU, стоит посмотреть в сторону Julia 1 от Supersonic Labs — другой подход к открытым моделям решений. А для задач, где важнее не решение, а векторное представление текста, подойдёт Cohere Embed 5 с 128K контекста.
Частые вопросы
Что такое decision-модель и зачем она нужна?
Это модель, которая отвечает не текстом, а вероятностями по заранее заданной схеме вопросов. Она удобна там, где нужен быстрый и однозначный ответ: маршрутизация агентов, классификация, оценка по шкале.
Чем Clef отличается от обычной LLM?
LLM генерирует токены и требует парсинга вывода. Clef читает состояние и схему вопросов и возвращает вероятность для каждого варианта ответа, без свободного текста.
Какие типы вопросов поддерживает Clef?
Три: noul (да/нет), choice (выбор одного варианта с вероятностями) и score (оценка по упорядоченной шкале).
На каких бенчмарках Clef обошла Jev?
На 7 из 10 бенчмарков в коротком списке Decision Index 0.2.1 от Cloudflare. Например, BANKING77: 94.20 против 79.74, CLINC150+OOS: 97.43 против 89.27.
В чём Jev всё ещё сильнее?
Jev лидирует на тестах, требующих широких знаний: GPQA Diamond (78.3 против 48.0), MMLU-Pro (82.7 против 65.9), BBH (92.9 против 73.7). Также Jev впереди в observability трассировок агентов.
Можно ли запустить Clef на своём железе?
Да, веса доступны на Hugging Face под Apache 2.0. Карточки моделей упоминают тестирование на одной H200 с BF16.
Как перейти с Jev на Clef?
Обе модели используют один и тот же API System One. Переход означает смену endpoint и имени модели.
Есть ли независимые проверки заявленных результатов?
Нет. Все числа в статье — данные вендора, независимой репликации пока не опубликовано.
Сколько вопросов можно задать в одном запросе?
На Workers AI один запрос несёт до 64 вопросов и до 4 изображений.
Какая задержка у моделей?
По внутреннему прогону Cloudflare медианная задержка Clef — 209.3 мс, Clef-flash — 38.8 мс, Jev — 524.1 мс.
Источник: marktechpost.com