Anthropic развела по нишам три модели, и вопрос «какую брать» стал не таким очевидным. Разбираем сравнение Claude Sonnet 5, Sonnet 4.6 и Opus 4.8 по бенчмаркам и ценам — по цифрам из исходного обзора.
Агентный кодинг
Главная метрика для агентных задач здесь — SWE-bench Pro:
- Sonnet 4.6 — 58,1%
- Sonnet 5 — 63,2%
- Opus 4.8 — 69,2%
По остальным тестам картина такая:
| Бенчмарк | Sonnet 4.6 | Sonnet 5 | Opus 4.8 |
|---|---|---|---|
| Terminal-Bench 2.1 | 67,0% | 80,4% | нет данных |
| OSWorld-Verified | 78,5% | 81,2% | нет данных |
| Humanity's Last Exam (с инструментами) | 46,8% | 57,4% | 57,9% |
| GDPval-AA v2 (интеллектуальная работа) | нет данных | 1618 | 1615 |
Цены (за миллион токенов)
Sonnet 5, вводная цена до 31 августа 2026 года: вход — 2 $, выход — 10 $. После 31 августа стандартная: вход — 3 $, выход — 15 $.
Sonnet 4.6: вход — 3 $, выход — 15 $.
Opus 4.8: вход — 5 $, выход — 25 $.
Контекст
У Sonnet 5 — окно контекста в 1 миллион токенов. По остальным моделям в сравнении цифры контекста не приводятся.
Что из этого следует
Вывод обзора простой: большую часть агентного кодинга, работы с инструментами и интеллектуальных задач стоит направлять на Sonnet 5 — он выигрывает по соотношению цены и качества. Opus 4.8 приберечь для задач, где критична точность: на верхней планке он остаётся лидером по точности. Sonnet 4.6 при этом оказывается в неудобном положении — по цене он равен новому Sonnet 5, но уступает ему по метрикам.