Cognition SWE-2: кодинг-модель на базе Kimi K3 обошла Fable 5.1 по цене

Cognition, компания за агентом-программистом Devin, выпустила SWE-2 — свою самую сильную кодинг-модель на сегодня. Она дообучена с подкреплением на базе Kimi K3, открытой модели Moonshot AI с 2,8 трлн параметров. Заявленный результат — 50,0% на FrontierCode 1.1 Main: отставание от Fable 5.1 в пределах одного пункта при цене на 64% ниже. Это также первая модель Cognition с выбираемыми уровнями reasoning, и все они обучены за один прогон RL.

Развернуть у себя не получится

Открытых весов у SWE-2 нет, отдельного API тоже. Модель работает только внутри Devin: сегодня это Devin Desktop и Devin CLI, а Devin Web и Fusion находятся в процессе раскатки. Для оплаченных тарифов доступ бесплатный до 10 октября 2026 года. Если нужен именно локальный инференс, посмотрите на Hermes Desktop — там модели запускаются на своём железе в один клик.

Что такое SWE-2

SWE-2 продолжает инфраструктуру и рецепт SWE-1.7, которая дообучалась от Kimi K2.7. На этот раз Cognition масштабировала RL до режима в несколько триллионов параметров, взяв базовую модель почти в 3 раза крупнее. По словам компании, RL всё ещё находит существенный запас поверх K3, добавляя 5–6 пунктов на многих бенчмарках.

Главное изменение — алгоритм RL, который обучает все три уровня усилий за один прогон. У каждого уровня свой штраф за стоимость, поэтому вся граница «цена — производительность» сдвигается сразу.

Результаты бенчмарков

Cognition опубликовала таблицу. Где были публичные результаты, использованы они; в остальных случаях каждая модель запускалась в своей штатной обвязке с максимальным старанием.

Бенчмарк SWE-2 Kimi K3 Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra SWE-1.7
FrontierCode 1.1 Main 50,0% 44,2% 48,0% 50,9% 47,5% 53,3% 42,0%
DeepSWE 1.1 73,0% 68,5% 67,5% 67,4% 72,7% 74,1% 37,7%
Terminal-Bench 2.1 92,8% 88,3% 88,4% 91,4% 88,8% 89,9% 81,5%
Terminal-Bench 4 27,3% 21,5% 20,3% 55,8% 37,3% 57,9% 7,6%

SWE-2 лидирует на Terminal-Bench 2.1 и обходит свою базу K3 в каждой строке. Cognition говорит, что модель подходит на несколько пунктов к GPT-6 Astra при четверти стоимости. Явная слабость — Terminal-Bench 4, где SWE-2 отстаёт от Fable 5.1 и GPT-6 Astra примерно на 30 пунктов. FrontierCode — собственный бенчмарк Cognition, и все цифры конкурентов взяты из её оценки.

Меньше лишних шагов

SWE-1.7 склонна была чрезмерно исследовать простые задачи. В SWE-2 с этим борются через то, что Cognition называет focused exploration. На FrontierCode 1.1 Main уровень medium набирает больше, чем SWE-1.7, делая на 58% меньше шагов и тратя на 81% меньше. Среднее число шагов на прогон падает со 127 (SWE-1.7) до 53 (medium), 80 (high) и 98 (max). Первое настоящее редактирование SWE-2 medium делает медианно после 18 шагов против 48 у SWE-1.7.

Команда также отмечает три поведенческих паттерна: более сильное сквозное покрытие тестами, находчивость при заблокированном инструменте и дисциплину проверки. При возражении модель заново выводит заключение, а не повторяет его.

Как её обучали

  • Штрафы за стоимость по Парето. Награда R = S минус lambda, умноженная на C, где S — бинарный успех, а C смешивает стоимость инференса в долларах со временем прогона. Cognition доказывает, что только линейный штраф делает цель RL зависящей исключительно от средней стоимости и доли решённых задач. Для каждого уровня усилий lambda задаётся локальным наклоном кривой Парето базовой модели — так линия равной награды касается границы, и награда может расти только за счёт подъёма самой границы.
  • Базовая линия награды с весом длины. Cognition делится приёмом, используемым с SWE-1.6: величина градиента сильно коррелирует с длиной прогона, поэтому групповая база взвешивается по токенам — сумма (R x L), делённая на сумму L. В абляциях это удерживало расхождение KL между инференсом и обучением ниже и стабилизировало тренировку без дополнительных вычислений.
  • Обслуживание прогонов и численные форматы. Prefill delayer группирует близкие запросы, поднимая TPM на GPU и TPS на запрос на 10–20%. Спекулятивное декодирование DSpark ускоряет прогоны: черновая модель переобучена через SpecForge на 15% более длинные цепочки принятия, а затем обучается онлайн вместе с политикой. Ядра NVFP4 и FP8 с quantization-aware training снижают потребление памяти и рассогласование обучения и инференса ниже уровня SWE-1.7.
  • Данные. Cognition утроила число RL-сред, добавила слои следования инструкциям и построила маховик, который использует ранние чекпойнты SWE-2 для исправления ложных срабатываний и пропусков в верификаторах.

Проверки на надёжность

Cognition перезапустила две оценки из своего открытого исследования надёжности. На 145 политически чувствительных вопросах о Китае SWE-2 прошла 98,0% в целом: 99,8% на английском, 95,2% на упрощённом китайском и 99,1% на традиционном китайском. В тесте на контекстно-зависимую уязвимость при разных формулировках от заказчика ни одна формулировка не дала статистически значимого изменения ни для одной модели.

Частые вопросы

Можно ли запустить SWE-2 на своих серверах?

Нет. Открытых весов и отдельного API у модели нет — она доступна только внутри Devin: Desktop и CLI сейчас, Devin Web и Fusion в раскатке.

Сколько стоит пользование?

Для оплаченных тарифов доступ бесплатный до 10 октября 2026 года. Отдельного прайса для SWE-2 в релизе не приводится.

Насколько SWE-2 лучше прошлой модели Cognition?

На FrontierCode 1.1 Main — 50,0% против 42,0% у SWE-1.7. На Terminal-Bench 4 разрыв скромнее: 27,3% против 7,6%, но обе модели далеки от лидеров.

Что такое уровни reasoning и сколько их?

Это первая модель Cognition с выбираемыми уровнями усилий. Их три — medium, high и max, и все обучены за один прогон RL, а не отдельными запусками.

Где SWE-2 проигрывает конкурентам?

На Terminal-Bench 4: 27,3% против 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra — отставание около 30 пунктов. На FrontierCode 1.1 Main она тоже чуть позади Fable 5.1 (50,0% против 50,9%).

Насколько можно доверять этим цифрам?

FrontierCode — собственный бенчмарк Cognition, и все результаты конкурентов взяты из её же оценки. Публичные результаты использованы там, где они были, в остальных случаях модели запускались в своих штатных обвязках.

Что даёт focused exploration на практике?

Меньше лишних шагов и ниже счёт. На FrontierCode 1.1 Main уровень medium делает на 58% меньше шагов и стоит на 81% меньше, чем SWE-1.7, а первое редактирование начинает медианно после 18 шагов вместо 48.

Как обучали модель дешевле и быстрее?

Через линейный штраф за стоимость с lambda по наклону кривой Парето, взвешивание базовой линии награды по токенам, группировку запросов через prefill delayer и спекулятивное декодирование DSpark с ядрами NVFP4 и FP8.

Есть ли у модели ограничения по темам?

Cognition проверяла её на 145 политически чувствительных вопросах о Китае: 98,0% прохождения в целом, от 95,2% на упрощённом китайском до 99,8% на английском. Отдельный тест на контекстно-зависимую уязвимость не показал значимых различий между формулировками заказчика.

Источник: marktechpost.com