Cognition, компания за агентом-программистом Devin, выпустила SWE-2 — свою самую сильную кодинг-модель на сегодня. Она дообучена с подкреплением на базе Kimi K3, открытой модели Moonshot AI с 2,8 трлн параметров. Заявленный результат — 50,0% на FrontierCode 1.1 Main: отставание от Fable 5.1 в пределах одного пункта при цене на 64% ниже. Это также первая модель Cognition с выбираемыми уровнями reasoning, и все они обучены за один прогон RL.
Развернуть у себя не получится
Открытых весов у SWE-2 нет, отдельного API тоже. Модель работает только внутри Devin: сегодня это Devin Desktop и Devin CLI, а Devin Web и Fusion находятся в процессе раскатки. Для оплаченных тарифов доступ бесплатный до 10 октября 2026 года. Если нужен именно локальный инференс, посмотрите на Hermes Desktop — там модели запускаются на своём железе в один клик.
Что такое SWE-2
SWE-2 продолжает инфраструктуру и рецепт SWE-1.7, которая дообучалась от Kimi K2.7. На этот раз Cognition масштабировала RL до режима в несколько триллионов параметров, взяв базовую модель почти в 3 раза крупнее. По словам компании, RL всё ещё находит существенный запас поверх K3, добавляя 5–6 пунктов на многих бенчмарках.
Главное изменение — алгоритм RL, который обучает все три уровня усилий за один прогон. У каждого уровня свой штраф за стоимость, поэтому вся граница «цена — производительность» сдвигается сразу.
Результаты бенчмарков
Cognition опубликовала таблицу. Где были публичные результаты, использованы они; в остальных случаях каждая модель запускалась в своей штатной обвязке с максимальным старанием.
| Бенчмарк | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50,0% | 44,2% | 48,0% | 50,9% | 47,5% | 53,3% | 42,0% |
| DeepSWE 1.1 | 73,0% | 68,5% | 67,5% | 67,4% | 72,7% | 74,1% | 37,7% |
| Terminal-Bench 2.1 | 92,8% | 88,3% | 88,4% | 91,4% | 88,8% | 89,9% | 81,5% |
| Terminal-Bench 4 | 27,3% | 21,5% | 20,3% | 55,8% | 37,3% | 57,9% | 7,6% |
SWE-2 лидирует на Terminal-Bench 2.1 и обходит свою базу K3 в каждой строке. Cognition говорит, что модель подходит на несколько пунктов к GPT-6 Astra при четверти стоимости. Явная слабость — Terminal-Bench 4, где SWE-2 отстаёт от Fable 5.1 и GPT-6 Astra примерно на 30 пунктов. FrontierCode — собственный бенчмарк Cognition, и все цифры конкурентов взяты из её оценки.
Меньше лишних шагов
SWE-1.7 склонна была чрезмерно исследовать простые задачи. В SWE-2 с этим борются через то, что Cognition называет focused exploration. На FrontierCode 1.1 Main уровень medium набирает больше, чем SWE-1.7, делая на 58% меньше шагов и тратя на 81% меньше. Среднее число шагов на прогон падает со 127 (SWE-1.7) до 53 (medium), 80 (high) и 98 (max). Первое настоящее редактирование SWE-2 medium делает медианно после 18 шагов против 48 у SWE-1.7.
Команда также отмечает три поведенческих паттерна: более сильное сквозное покрытие тестами, находчивость при заблокированном инструменте и дисциплину проверки. При возражении модель заново выводит заключение, а не повторяет его.
Как её обучали
- Штрафы за стоимость по Парето. Награда R = S минус lambda, умноженная на C, где S — бинарный успех, а C смешивает стоимость инференса в долларах со временем прогона. Cognition доказывает, что только линейный штраф делает цель RL зависящей исключительно от средней стоимости и доли решённых задач. Для каждого уровня усилий lambda задаётся локальным наклоном кривой Парето базовой модели — так линия равной награды касается границы, и награда может расти только за счёт подъёма самой границы.
- Базовая линия награды с весом длины. Cognition делится приёмом, используемым с SWE-1.6: величина градиента сильно коррелирует с длиной прогона, поэтому групповая база взвешивается по токенам — сумма (R x L), делённая на сумму L. В абляциях это удерживало расхождение KL между инференсом и обучением ниже и стабилизировало тренировку без дополнительных вычислений.
- Обслуживание прогонов и численные форматы. Prefill delayer группирует близкие запросы, поднимая TPM на GPU и TPS на запрос на 10–20%. Спекулятивное декодирование DSpark ускоряет прогоны: черновая модель переобучена через SpecForge на 15% более длинные цепочки принятия, а затем обучается онлайн вместе с политикой. Ядра NVFP4 и FP8 с quantization-aware training снижают потребление памяти и рассогласование обучения и инференса ниже уровня SWE-1.7.
- Данные. Cognition утроила число RL-сред, добавила слои следования инструкциям и построила маховик, который использует ранние чекпойнты SWE-2 для исправления ложных срабатываний и пропусков в верификаторах.
Проверки на надёжность
Cognition перезапустила две оценки из своего открытого исследования надёжности. На 145 политически чувствительных вопросах о Китае SWE-2 прошла 98,0% в целом: 99,8% на английском, 95,2% на упрощённом китайском и 99,1% на традиционном китайском. В тесте на контекстно-зависимую уязвимость при разных формулировках от заказчика ни одна формулировка не дала статистически значимого изменения ни для одной модели.
Частые вопросы
Можно ли запустить SWE-2 на своих серверах?
Нет. Открытых весов и отдельного API у модели нет — она доступна только внутри Devin: Desktop и CLI сейчас, Devin Web и Fusion в раскатке.
Сколько стоит пользование?
Для оплаченных тарифов доступ бесплатный до 10 октября 2026 года. Отдельного прайса для SWE-2 в релизе не приводится.
Насколько SWE-2 лучше прошлой модели Cognition?
На FrontierCode 1.1 Main — 50,0% против 42,0% у SWE-1.7. На Terminal-Bench 4 разрыв скромнее: 27,3% против 7,6%, но обе модели далеки от лидеров.
Что такое уровни reasoning и сколько их?
Это первая модель Cognition с выбираемыми уровнями усилий. Их три — medium, high и max, и все обучены за один прогон RL, а не отдельными запусками.
Где SWE-2 проигрывает конкурентам?
На Terminal-Bench 4: 27,3% против 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra — отставание около 30 пунктов. На FrontierCode 1.1 Main она тоже чуть позади Fable 5.1 (50,0% против 50,9%).
Насколько можно доверять этим цифрам?
FrontierCode — собственный бенчмарк Cognition, и все результаты конкурентов взяты из её же оценки. Публичные результаты использованы там, где они были, в остальных случаях модели запускались в своих штатных обвязках.
Что даёт focused exploration на практике?
Меньше лишних шагов и ниже счёт. На FrontierCode 1.1 Main уровень medium делает на 58% меньше шагов и стоит на 81% меньше, чем SWE-1.7, а первое редактирование начинает медианно после 18 шагов вместо 48.
Как обучали модель дешевле и быстрее?
Через линейный штраф за стоимость с lambda по наклону кривой Парето, взвешивание базовой линии награды по токенам, группировку запросов через prefill delayer и спекулятивное декодирование DSpark с ядрами NVFP4 и FP8.
Есть ли у модели ограничения по темам?
Cognition проверяла её на 145 политически чувствительных вопросах о Китае: 98,0% прохождения в целом, от 95,2% на упрощённом китайском до 99,8% на английском. Отдельный тест на контекстно-зависимую уязвимость не показал значимых различий между формулировками заказчика.
Источник: marktechpost.com