Claude Sonnet 5 против Sonnet 4.6 и Opus 4.8: бенчмарки, цены и что выбирать

Anthropic развела по нишам три модели, и вопрос «какую брать» стал не таким очевидным. Разбираем сравнение Claude Sonnet 5, Sonnet 4.6 и Opus 4.8 по бенчмаркам и ценам — по цифрам из исходного обзора.

Агентный кодинг

Главная метрика для агентных задач здесь — SWE-bench Pro:

  • Sonnet 4.6 — 58,1%
  • Sonnet 5 — 63,2%
  • Opus 4.8 — 69,2%

По остальным тестам картина такая:

Бенчмарк Sonnet 4.6 Sonnet 5 Opus 4.8
Terminal-Bench 2.1 67,0% 80,4% нет данных
OSWorld-Verified 78,5% 81,2% нет данных
Humanity's Last Exam (с инструментами) 46,8% 57,4% 57,9%
GDPval-AA v2 (интеллектуальная работа) нет данных 1618 1615

Цены (за миллион токенов)

Sonnet 5, вводная цена до 31 августа 2026 года: вход — 2 $, выход — 10 $. После 31 августа стандартная: вход — 3 $, выход — 15 $.

Sonnet 4.6: вход — 3 $, выход — 15 $.

Opus 4.8: вход — 5 $, выход — 25 $.

Контекст

У Sonnet 5 — окно контекста в 1 миллион токенов. По остальным моделям в сравнении цифры контекста не приводятся.

Что из этого следует

Вывод обзора простой: большую часть агентного кодинга, работы с инструментами и интеллектуальных задач стоит направлять на Sonnet 5 — он выигрывает по соотношению цены и качества. Opus 4.8 приберечь для задач, где критична точность: на верхней планке он остаётся лидером по точности. Sonnet 4.6 при этом оказывается в неудобном положении — по цене он равен новому Sonnet 5, но уступает ему по метрикам.