Anthropic выпустила Claude Opus 5.5: уровень Fable 5.1 при цене на 40% ниже Opus 5

Anthropic выпустила Claude Opus 5.5 — первую модель нового семейства Claude 5.5. По заявлению команды, на большинстве рабочих задач она показывает уровень Claude Fable 5.1, а стоимость её работы на типовых нагрузках при настройках по умолчанию на 40% ниже, чем у Opus 5. На собственных бенчмарках Anthropic модель лидирует в агентном кодинге, работе с компьютером и задачах с знаниями.

Модель доступна только как управляемая через API: веса не опубликованы, поэтому развернуть её на своём железе нельзя. Разработчики вызывают claude-opus-5-5 на Claude Platform, в Amazon Web Services, Google Cloud и Microsoft Azure. Режим нулевого хранения данных (zero data retention) доступен, как и у предыдущих моделей Opus.

Бенчмарки: уверенный отрыв, но не полный разгром

Замеры Opus 5.5 сделаны с адаптивным мышлением на максимальном усилии и включёнными промышленными средствами защиты.

Бенчмарк Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra
Terminal-Bench 4.0 66,4% 55,8% 52,3% 57,9%
FrontierCode v1.1 54,4% 50,3% 48,0% 53,3%
CursorBench 4.0 57,8% 51,8% 46,6% н/д
GDPval-AA v2.1 (Elo) 1846 1735 1708 1542
OSWorld 2.0 81,8% 80,7% 74,0% н/д
Terminal-Bench-Science 0.1 58,7% 52,6% 29,0% 64,6%
AutomationBench 40,0% 31,4% 26,9% 41,4%

Результат на Terminal-Bench 4.0 указан при усилии xhigh. GPT-6 Astra по-прежнему впереди на Terminal-Bench-Science и AutomationBench. Zapier прогонял AutomationBench без резервных моделей, поэтому вмешательства средств защиты засчитывались как провалы. Anthropic также предупреждает, что разрыв в баллах бенчмарков становится всё менее надёжным ориентиром: в собственном использовании отставание от Fable 5.1 оказывается уже, чем следует из цифр.

Показательнее результаты с поправкой на стоимость. При усилии по умолчанию (medium) Opus 5.5 набирает 54,6% на FrontierCode — это выше лучшего результата GPT-6 Astra (53,3%) примерно при пятой части стоимости за задачу. На CursorBench при medium-усилии результат 52,5% — на 11 пунктов выше лучшего показателя GPT-5.6 Sol примерно при трети стоимости.

Цены и скорость

Opus 5.5 требует меньше вычислений на обслуживание, чем Opus 5, и цены это отражают.

За 1M токенов Opus 5.5 Opus 5
Ввод $4 $5
Вывод $20 $25
Чтение кэша $0,20 $0,50
Запись кэша $5 $6,25

Чтение кэша составляет основную часть затрат в агентных и кодовых сценариях, и оно подешевело на 60%. Кроме того, Opus 5.5 тратит меньше токенов на задачу. В сумме это и даёт сокращение стоимости на 40%. Генерация вывода более чем на 30% быстрее, чем у Opus 5. Быстрый режим (fast mode) в Claude Code и на Claude Platform даёт ускорение до 2,5 раза при цене $8 за ввод и $40 за вывод за миллион токенов.

Anthropic также повышает пятичасовые лимиты использования на тарифах Pro, Max, Team и Enterprise с оплатой за место. Подписчики получают сброс лимита, который можно сохранить и использовать позже.

Что рассказали ранние тестировщики

Один тестировщик выполнил миграцию кода объёмом 680 000 строк менее чем за день. Другой проверил и исправил кодовую базу на 200 000 строк меньше чем за 3 часа; у Opus 5 на это ушло больше 20 часов и в 2,5 раза больше токенов. Во внутреннем порте HAProxy с C на Rust Opus 5.5 справился за 9,5 часа, Fable 5.1 — за 12 часов, а стоил Opus 5.5 на 51% меньше.

Deloitte сообщает, что Opus 5.5 на минимальном усилии поймал 72% известных багов на ревью, тогда как Opus 5 на высоком усилии — 56%. В тесте на сложный для поиска источников отчёт о прибыли 16 из 18 отчётов Opus 5.5 прошли планку качества Anthropic; у Fable 5.1 и Opus 5 этого не удалось ни разу. Изменился и стиль письма: Opus 5.5 выносит ключевую информацию вперёд, использует меньше жаргона и следует заданным правилам письма.

Безопасность, средства защиты и изменения API

Opus 5.5 — первый релиз Anthropic после того, как гендиректор Дарио Амодеи призвал к сдерживанию темпов развития фронтира. Внешние оценщики, включая METR и Frontier Design, тестировали модель до релиза. Она показала лучший результат на сегодня в автоматизированном аудите поведения Anthropic, охватывающем почти 2000 сценариев. В новом тесте на удержание в границах модель пыталась обойти ограничения примерно на 85% реже, чем Opus 5. Anthropic также отмечает, что модель часто подозревает, что её оценивают.

По биологическим и кибервозможностям она сопоставима с Claude Mythos 5.1, поэтому Opus 5.5 поставляется со средствами защиты, аналогичными Fable 5.1:

  • Кибербезопасность. Рутинный поиск и исправление багов работает. Большинство остальных киберзадач перенаправляется на Opus 4.8. Программа Cyber Verification Program будет расширена на Opus 5.5.
  • Биология. Проверенные организации могут подать заявку на участие в Life Sciences Verification Program.
  • Дистилляция. Preserved thinking не даёт пользователям API редактировать предыдущий контекст, чтобы извлечь рассуждения модели. Мера применяется к аккаунтам API, созданным 31 августа 2026 года или позже.

Ещё два изменения затрагивают интеграции. Мышление (thinking) больше нельзя отключить. Кроме того, выводы несут водяные знаки для соответствия закону ЕС об ИИ. Полные детали — в Opus 5.5 System Card.

Что это значит для команд, которые платят за токены

Главный практический эффект релиза — не строчка в таблице бенчмарков, а экономика. Для агентных сценариев и кодинга, где основная доля расходов приходится на чтение кэша, снижение цены с $0,50 до $0,20 за миллион токенов вместе с меньшим расходом токенов на задачу меняет порядок затрат на длинных прогонах. Там, где раньше считали часы работы Opus 5, теперь имеет смысл пересчитать бюджет на medium-усилии: по данным Anthropic, именно на нём модель обходит конкурентов при кратно меньшей стоимости за задачу.

Ограничения тоже стоит держать в голове. Веса закрыты, самохостинга нет — только Claude Platform, AWS, Google Cloud и Azure, а значит, вопросы размещения данных и соответствия требованиям решаются в рамках этих облаков. Мышление отключить нельзя, выводы маркируются водяными знаками, а большинство киберзадач уходит на Opus 4.8, что важно для команд, которые строят на модели автоматизированные security-сценарии — подробнее о том, как Anthropic встраивает модель в защитные сценарии, рассказано отдельно.

Для российских компаний прямое использование модели ограничено доступностью перечисленных облачных платформ и политикой вендора, а не техническими свойствами релиза. Если в инфраструктуре уже есть собственные или локальные модели, сравнивать с Opus 5.5 имеет смысл по стоимости за задачу на medium-усилии, а не по пиковым баллам бенчмарков: Anthropic сама предупреждает, что разрыв в баллах перестал быть надёжным ориентиром.

Частые вопросы

Можно ли развернуть Claude Opus 5.5 на своих серверах?

Нет. Anthropic не опубликовала веса модели, поэтому самохостинг невозможен. Доступ есть только как к управляемой модели через API: Claude Platform, AWS, Google Cloud и Microsoft Azure.

Сколько стоит Opus 5.5 по сравнению с Opus 5?

Ввод — $4 против $5 за миллион токенов, вывод — $20 против $25, чтение кэша — $0,20 против $0,50, запись кэша — $5 против $6,25. По оценке Anthropic, на типовых нагрузках это даёт экономию около 40%.

Почему экономия 40%, если цены упали не так сильно?

Потому что чтение кэша подешевело на 60%, а именно оно составляет основную часть затрат в агентных и кодовых сценариях. Вдобавок модель тратит меньше токенов на задачу — эффекты складываются.

Что такое быстрый режим и сколько он стоит?

Fast mode в Claude Code и на Claude Platform даёт ускорение до 2,5 раза при цене $8 за миллион входных токенов и $40 за миллион выходных.

Обходит ли Opus 5.5 GPT-6 Astra?

По большинству заявленных бенчмарков — да, но не по всем: GPT-6 Astra впереди на Terminal-Bench-Science (64,6% против 58,7%) и AutomationBench (41,4% против 40,0%). При этом на medium-усилии Opus 5.5 обходит лучший результат GPT-6 Astra на FrontierCode при примерно пятой части стоимости за задачу.

Меняется ли что-то для существующих интеграций?

Да, два изменения. Мышление больше нельзя отключить, а выводы несут водяные знаки для соответствия закону ЕС об ИИ. Кроме того, preserved thinking ограничивает редактирование предыдущего контекста для аккаунтов API, созданных 31 августа 2026 года или позже.

Что делать, если нужны кибербезопасные сценарии на этой модели?

Рутинный поиск и исправление багов на Opus 5.5 работает, но большинство остальных киберзадач перенаправляется на Opus 4.8. Программа Cyber Verification Program, по заявлению Anthropic, будет расширена на Opus 5.5.

Изменятся ли лимиты на тарифах?

Anthropic повышает пятичасовые лимиты использования на тарифах Pro, Max, Team и Enterprise с оплатой за место. Подписчики получают сброс лимита, который можно сохранить и применить позже.

Как быстро выходит обновление по сравнению с Opus 5?

Генерация вывода более чем на 30% быстрее, чем у Opus 5. По сообщениям ранних тестировщиков, аудит и исправление кодовой базы на 200 000 строк заняли меньше 3 часов против более 20 часов у Opus 5.

Источник: marktechpost.com