Cloudflare Clef и Clef-flash: открытые decision-модели вместо текста возвращают вероятности

Cloudflare представила Clef и Clef-flash — первые модели, обученные командой Workers AI. Это не чат-боты, а decision-модели: на вход они получают состояние и схему типизированных вопросов, на выходе дают вероятность для каждого допустимого ответа, без свободного текста. Обе модели открыты под лицензией Apache 2.0 и совместимы с API Jev от TypeSafe AI.

Развёртывание доступно уже сейчас: модели работают на Workers AI, а веса выложены на Hugging Face для самостоятельного хостинга.

Чем decision-модель отличается от LLM

Обычная LLM генерирует токены по одному, и её вывод ещё нужно разбирать парсером. Decision-модель отвечает только на фиксированный набор вопросов о входных данных. Clef поддерживает три типа вопросов:

  • noul — да/нет, возвращает вероятность «да»;
  • choice — выбор одного именованного варианта с вероятностями по каждому и значением уверенности;
  • score — оценка по упорядоченной шкале, возвращает взвешенный по вероятностям балл.

На Workers AI один запрос может нести до 64 вопросов и до 4 изображений.

TypeSafe AI запустила Jev, свою первую модель «System One», 15 сентября 2026 года. Затем появились открытые альтернативы Kev-9B и Laya. Clef использует тот же API System One: переход с Jev означает смену endpoint и имени модели.

Как устроена Clef

Clef дообучена на базе Qwen3.8-27B, Clef-flash — на Qwen3.5-9B. Обе сохраняют vision-энкодер исходного бэкбона.

Инференс проходит в два этапа. Сначала бэкбон выполняет единственный проход prefill-only по состоянию и вопросам. Затем небольшой трансформер — joint schema head — читает финальные скрытые состояния: он направляет свидетельства к каждому вопросу, позволяет полям cross-attend и совместно оценивает все варианты. Softmax по каждому вопросу превращает логиты в вероятности.

При обучении оба бэкбона заморожены, а routing head оптимизируется совместно с low-rank адаптерами ранга 256. Функция потерь сочетает label-smoothed cross-entropy с Brier loss для калибровки. Дополнительная цель — Reinforcement Learning for Calibrated Decisions (RLCD) — даёт частичный кредит за соседние порядковые варианты.

Бенчмарки: где Clef выигрывает, а где нет

На коротком списке Cloudflare из 10 бенчмарков набора Decision Index 0.2.1 модель Clef показала лучший результат в 7 случаях:

  • BANKING77 (macro-F1): Clef 94.20 против Jev 79.74;
  • CLINC150+OOS (macro-F1): Clef 97.43 против Jev 89.27;
  • Home appliances (case exact): Clef-flash 97.73 против Jev 52.27.

В других тестах Jev сохраняет явное лидерство. Полная карточка модели показывает преимущество Jev на GPQA Diamond (78.3 против 48.0), MMLU-Pro (82.7 против 65.9) и BBH (92.9 против 73.7).

На собственных workflow-тестах TypeSafe Clef обошла Jev в 3 из 4 областей с небольшим отрывом: обработка счетов — 64.7 против 61.8, клиентский сервис — 76.3 против 76.0, инциденты безопасности — 62.9 против 61.7. Jev лидирует в observability трассировок агентов: 71.6 против 68.5.

В сценарии threat intelligence от Cloudflare Clef классифицировала домен за 2.2 секунды, тогда как gpt-oss-120b потратила 4.7 секунды.

Все числа заявлены вендором, независимой проверки пока нет.

Сравнение характеристик

Параметр Clef Clef-flash Jev Kev-9B Laya
Разработчик Cloudflare Cloudflare TypeSafe AI Jared Palmer Convai Innovations
Размер 27B 9B не раскрыт 9B + 45.4M LoRA 421M
Бэкбон Qwen3.8-27B Qwen3.5-9B не раскрыт Qwen3.5-9B-Base ModernBERT-large
Веса Apache 2.0 Apache 2.0 hosted API Apache 2.0 Apache 2.0
Ввод изображений да да нет нет нет
Контекст 65 536 65 536 32K (по данным Cloudflare) 65 536 (8192 проверено) 512 (английский)
Медианная задержка* 209.3 мс 38.8 мс 524.1 мс 51.4 мс 5.8 мс
Цена хостинга (вход) $0.24/M $0.09/M $0.042/M self-host self-host

*Внутренний прогон Decision Index от Cloudflare. Все пять моделей реализуют API System One.

Развёртывание и дообучение

Обе модели вызываются через биндинг Workers AI (env.AI.run()), REST API или AI Gateway. Для самостоятельного хостинга карточки моделей упоминают тестирование на одной H200 с весами BF16.

Cloudflare также анонсировала сервис reinforcement learning для настройки Clef на приватных данных. Он стартует с forward-deployed инженеров Cloudflare, а self-serve платформа появится позже. Пайплайн объединяет AI Gateway, Workers AI, Containers и новый компонент Trainer. Команды могут подать заявку через форму design partner.

Для администратора, который выбирает модель для маршрутизации агентов, практическая разница такая: Clef и Clef-flash не требуют парсинга вывода и возвращают калиброванные вероятности по фиксированной схеме, что упрощает интеграцию. Но на задачах, требующих широких знаний — GPQA Diamond, MMLU-Pro, BBH — они уступают Jev, так что для сложных рассуждений decision-модель не замена универсальной LLM. Если же нужна именно компактная модель на CPU, стоит посмотреть в сторону Julia 1 от Supersonic Labs — другой подход к открытым моделям решений. А для задач, где важнее не решение, а векторное представление текста, подойдёт Cohere Embed 5 с 128K контекста.

Частые вопросы

Что такое decision-модель и зачем она нужна?

Это модель, которая отвечает не текстом, а вероятностями по заранее заданной схеме вопросов. Она удобна там, где нужен быстрый и однозначный ответ: маршрутизация агентов, классификация, оценка по шкале.

Чем Clef отличается от обычной LLM?

LLM генерирует токены и требует парсинга вывода. Clef читает состояние и схему вопросов и возвращает вероятность для каждого варианта ответа, без свободного текста.

Какие типы вопросов поддерживает Clef?

Три: noul (да/нет), choice (выбор одного варианта с вероятностями) и score (оценка по упорядоченной шкале).

На каких бенчмарках Clef обошла Jev?

На 7 из 10 бенчмарков в коротком списке Decision Index 0.2.1 от Cloudflare. Например, BANKING77: 94.20 против 79.74, CLINC150+OOS: 97.43 против 89.27.

В чём Jev всё ещё сильнее?

Jev лидирует на тестах, требующих широких знаний: GPQA Diamond (78.3 против 48.0), MMLU-Pro (82.7 против 65.9), BBH (92.9 против 73.7). Также Jev впереди в observability трассировок агентов.

Можно ли запустить Clef на своём железе?

Да, веса доступны на Hugging Face под Apache 2.0. Карточки моделей упоминают тестирование на одной H200 с BF16.

Как перейти с Jev на Clef?

Обе модели используют один и тот же API System One. Переход означает смену endpoint и имени модели.

Есть ли независимые проверки заявленных результатов?

Нет. Все числа в статье — данные вендора, независимой репликации пока не опубликовано.

Сколько вопросов можно задать в одном запросе?

На Workers AI один запрос несёт до 64 вопросов и до 4 изображений.

Какая задержка у моделей?

По внутреннему прогону Cloudflare медианная задержка Clef — 209.3 мс, Clef-flash — 38.8 мс, Jev — 524.1 мс.

Источник: marktechpost.com