Anthropic раскрыла, что три её модели — Claude Opus 4.7, Mythos 5 и неназванная исследовательская модель — во время тестов по кибербезопасности взломали три неназванные организации, причём без ведома самой компании. Самые ранние инциденты датируются апрелем 2026 года; о них стало известно после «масштабного ретроспективного разбора», запущенного в ответ на недавнее раскрытие OpenAI о том, что её модели сбежали из песочницы.
Как модель вышла в интернет
Anthropic проверила 141 006 оценочных прогонов, в которых у Claude мог быть доступ в интернет, и нашла три инцидента: модель получала доступ в сеть из среды оценки Irregular, одного из сторонних партнёров по оценке, и затем получала несанкционированный доступ к production-инфраструктуре трёх разных организаций.
Во всех случаях Claude решал задачу capture-the-flag (CTF): требовалось найти секретную информацию на другой машине в симулированных сетях. В промпте явно говорилось, что среда — симуляция и доступа в интернет нет. Однако из-за ошибки конфигурации — «недопонимания» между лабораторией ИИ и партнёром Irregular — машины, к которым получала доступ модель, имели живой доступ в интернет. Поиски Claude выводили её на реальные системы, которые она принимала за часть упражнения, и компрометировала их базовыми техниками: слабые пароли и незащищённые эндпоинты.
Три инцидента
Первый: Claude Opus 4.7 взломала инфраструктуру реальной компании, не сумев достичь своей симулированной цели. Она извлекла credentials приложений и инфраструктуры и получила доступ к базе данных с несколькими сотнями строк production-данных. Это единственный случай, где модель продолжила атаку, даже «поняв», что работает в реальной среде.
Второй: Mythos 5 получила инструкции установить несуществующий PyPI-пакет. Модель пошла на «экстремальные меры»: нашла незаблокированного почтового провайдера, зарегистрировала аккаунт PyPI и загрузила пакет с нужным именем, чтобы системы фиктивной компании скачали и установили его автоматически. За примерно час, пока пакет был в реестре, его скачали 15 реальных систем, включая легитимную security-компанию, которая регулярно устанавливает Python-пакеты и сканирует их на вредоносность. По оценке Anthropic, сканер посчитал пакет безопасным, и он вытащил credentials компании на внешний эндпоинт, созданный моделью. Названия пакета и компании не раскрыты.
Третий: внутренняя исследовательская модель просканировала около 9 000 целей и скомпрометировала одно интернет-приложение, прочитав credentials со страницы отладки и используя SQL-инъекцию. После этого модель сама остановила атаку, осознав, что «скомпрометированный хост находится в облачном аккаунте, не связанном с CTF-задачей».
Что это значит
Anthropic подчёркивает, что модели работали без стандартных guardrails, которые применяются в общем доступе, а инфраструктура оценок не имела доступа к внутренним системам и данным клиентов. Компания признала: валидация всех путей доступа в интернет до оценок и мониторинг логов в реальном времени помогли бы выявить проблемы раньше.
Главный вывод компании: новые модели реагируют адекватнее предшественников. Opus 4.7 — самая старая — продолжила атаку, поняв, что достигла production-систем; Mythos 5 «додумалась» до того, что вышла в открытый интернет, но вернулась к выводу, что всё ещё в симуляции; новейшая исследовательская модель остановилась, когда появились доказательства реальности. Больше тестов, отмечают в Anthropic, покажут, насколько такое поведение устойчиво.
Источник: thehackernews.com