Fireworks AI выпустила Ember-1: постобученный Kimi K3 тратит на 40% меньше токенов

Fireworks AI выпустила Ember-1 — специализированную модель от Fireworks Research, полученную постобучением открытой модели Kimi K3 от Moonshot AI. Главная идея: модель учится строить более короткие цепочки рассуждений, не теряя точности на задачах. Это принципиально иной подход, чем просто снижение уровня reasoning effort на этапе инференса. По данным Fireworks, Ember-1 выдаёт качество Kimi K3 примерно на 40% меньшим числом токенов.

Отдельно стоит сказать о доступности: модель можно использовать только через serverless API Fireworks в статусе Research Preview. Веса, код обучения и точные алгоритмы тренировки не опубликованы, поэтому развернуть Ember-1 на своём железе сегодня нельзя.

Почему reasoning-модели тратят слишком много

Команда Fireworks отмечает, что такие модели, как Kimi K3, иногда расходуют более 90% сгенерированных токенов на внутренние рассуждения. В многоходовых агентных сценариях эта цена накапливается: каждый новый ход заново передаёт модели предыдущие рассуждения. Контекст растёт примерно квадратично с числом ходов, а длинные цепочки из ранних шагов перечитываются и оплачиваются заново при каждом последующем вызове.

Клиенты хотели получить кодинг-способности K3 дешевле. Понижение reasoning effort проблему не решило: на низких уровнях качество падало слишком сильно. Тогда команда решила не урезать рассуждения, а научить модель рассуждать эффективнее.

Как обучали Ember-1

Не все рассуждения K3 — лишняя работа. Часть из них полезна: это самопроверка, возврат к ранее сделанному предположению, реакция на обратную связь. Ember-1 сохраняет такое поведение, но отсекает избыточные рассуждения и непродуктивные циклы.

Обучающая выборка охватывает математику, программирование, следование инструкциям, диалог, поиск, работу с инструментами и разработку ПО. В неё вошли как отдельные задачи, так и длительные многошаговые взаимодействия. Обратная связь от задачи и окружения направляет on-policy планирование и обучение. Команда провела более 50 обучающих экспериментов и свыше 200 оценок, а также разработала новые алгоритмы обучения, которые не публикует. Всё обучение шло на Fireworks Serverless Training; Fireworks утверждает, что использовала только собственные данные, без данных клиентов.

Результаты бенчмарков

Fireworks сравнила Ember-1 с Kimi K3 на трёх уровнях reasoning effort. Стоимость считалась по публичным ценам API Kimi K3. Это собственные опубликованные оценки Fireworks:

Бенчмарк N K3 Low K3 High K3 Max Ember-1 Ember-1 против K3 Max (стоимость)
Terminal Bench 2.1 89 76,4% 77,6% 80,9% 82,0% −51,9% / −23,1 USD
SWE-bench Verified 500 80,4% 86,0% 93,2% 92,2% −15,5% / −68,1 USD
SWE-Interact 75 6,7% 13,3% 21,3% 20,0% −32,5% / −60,8 USD
DeepSWE 1.1 113 55,8% 62,8% 66,4% 75,2% −23,7% / −126,9 USD
τ-2 Bench Airline 50 64% 64% 64% 66% −5,9% / −0,3 USD

Ember-1 опережает K3 Max на Terminal Bench 2.1 и DeepSWE 1.1, немного уступает на SWE-bench Verified и SWE-Interact. По словам Fireworks, на семи бенчмарках и на продакшен-трафике двух клиентов рассуждения K3 удалось сократить на 35–50% без потери точности.

На Bedside Bench от Doximity — наборе из 500 клинических случаев, проверенных врачами, — Ember-1 вышла на новую границу Парето по стоимости за задачу. Этот результат получен с помощью нового Specialized Intelligence Index от Fireworks.

Продакшен A/B-тест

Fireworks провела живые A/B-тесты с двумя клиентами на рабочих кодинг-нагрузках. Оба увидели примерно на 35% меньше токенов на задачу при сопоставимом качестве. В опубликованном прогоне выходные токены упали с 49,3K до 29,9K на задачу. Токены рассуждений сократились на 71,3%, общее число токенов — на 39%. Оценка задачи практически не изменилась: 0,753 у Ember-1 против 0,751 у K3. Среднее число шагов снизилось с 23,8 до 21,4. Один клиент уже использует Ember-1 в продакшене.

Цена за токен у Ember-1 на Fireworks такая же, как у Kimi K3: 3,00 USD за входные, 0,30 USD за кэшированные входные и 15,00 USD за выходные на 1 млн токенов. Вся экономия — за счёт меньшего числа сгенерированных токенов. При такой цене выхода цифры A/B-теста дают примерно 0,74 USD против 0,45 USD на задачу по выходным токенам (расчёт самого донора, только выход).

Что это значит для практики

Главный вывод для тех, кто платит за инференс: экономить можно не только выбором модели подешевле или снижением reasoning effort, но и постобучением под конкретный класс задач. Для агентных сценариев с длинными многоходовыми цепочками это особенно чувствительно, потому что там старые рассуждения перечитываются на каждом шаге. Похожий приём — постобучение Kimi K3 под узкую задачу — уже показала кодинг-модель SWE-2 от Cognition, а идею экономии токенов рассуждения ценой доли точности проверяли на примере ThinkingCap-Qwen3.8-27B. Практическая рекомендация из опубликованных данных одна: если у вас агентные кодинг-нагрузки на Kimi K3, стоит сравнить их с Ember-1 на своём трафике — при условии, что вы готовы работать через serverless API Fireworks и мириться со статусом Research Preview.

Пока веса и код обучения закрыты, самостоятельного развёртывания не будет, и это ограничение стоит учитывать при планировании. Кроме того, все приведённые цифры — собственные оценки Fireworks, а не независимые замеры.

Частые вопросы

Что такое Ember-1?

Это модель от Fireworks Research, полученная постобучением открытой Kimi K3 от Moonshot AI. Она учится строить более короткие цепочки рассуждений, сохраняя точность на задачах.

Чем это отличается от снижения reasoning effort?

При снижении effort вы урезаете рассуждения на этапе инференса и теряете качество. Ember-1 переобучена так, чтобы рассуждать эффективнее: лишние циклы отсекаются, а полезная самопроверка сохраняется.

Можно ли развернуть Ember-1 у себя?

Нет. Модель доступна только через serverless API Fireworks в статусе Research Preview. Веса, код обучения и точные алгоритмы не опубликованы.

Сколько стоит использование?

Цена за токен такая же, как у Kimi K3 на Fireworks: 3,00 USD за входные, 0,30 USD за кэшированные входные и 15,00 USD за выходные на 1 млн токенов. Экономия возникает за счёт меньшего числа сгенерированных токенов.

Насколько меньше токенов тратит Ember-1?

Fireworks заявляет около 40% экономии токенов. В продакшен A/B-тесте с двумя клиентами выходные токены упали с 49,3K до 29,9K на задачу, токены рассуждений — на 71,3%, общее число токенов — на 39%.

Стала ли модель хуже по качеству?

По опубликованным оценкам — нет. В A/B-тесте оценка задачи составила 0,753 против 0,751 у K3. На Terminal Bench 2.1 и DeepSWE 1.1 Ember-1 опережает K3 Max, на SWE-bench Verified и SWE-Interact немного уступает.

Кому это интересно в первую очередь?

Тем, кто гоняет агентные кодинг-нагрузки на Kimi K3 и платит за токены. В многоходовых сценариях контекст растёт примерно квадратично с числом ходов, и сокращение рассуждений даёт заметный эффект на счёте.

Можно ли проверить результаты независимо?

Пока нет: все приведённые цифры — собственные опубликованные оценки Fireworks, включая результаты на Bedside Bench от Doximity и Specialized Intelligence Index.

Источник: marktechpost.com