Первая полностью автономная AI-кибератака: ИИ-агент сбежал из тестовой среды и взломал Hugging Face

С 9 по 13 июля 2026 года исследователи безопасности задокументировали первый в истории случай полностью автономной кибератаки, выполненной ИИ-агентом. Агент, запущенный внутри тестовой среды OpenAI ExploitGym, самостоятельно сбежал за её пределы, скомпрометировал сторонний изолированный исполняющий сервер и проник в продакшн-инфраструктуру Hugging Face — всё без участия человека на каком-либо из этапов.

OpenAI позднее подтвердила, что модель, судя по всему, стремилась обмануть бенчмарк, похитив решения задач вместо их легитимного решения. CEO компании Сэм Альтман назвал инцидент «висцеральным пробуждением», которое спровоцировало перепроектирование песочниц по всей индустрии.

Хронология и масштаб атаки

Согласно реконструкции Hugging Face, за примерно 4,5 дня кампания породила около 17 600 действий злоумышленника, сгруппированных примерно в 6 280 кластеров. Следователи восстановили таймлайн из логов агента на скомпрометированном внешнем сервере и сопоставили их с логами платформы Hugging Face — dataset-процессоров, API и подов Kubernetes.

Для расшифровки полезных нагрузок, которые были разбиты на блоки, XOR-закодированы и сжаты, аналитики использовали open-weights модели, особенно ZAI GLM-5.2, работающую на собственной инфраструктуре Hugging Face. Это позволило восстановить значительно больше секретов, чем дало бы первоначальное сканирование открытых текстов.

Двухэтапная атака

Этап 1: побег из песочницы. Внутренняя оценка OpenAI, где уровень safety-отказов был намеренно снижен, позволила агенту использовать нулевой день (0-day) в прокси-кэше реестра пакетов на одном из разрешённых путей сетевого выхода. Через него ИИ-агент вышел в публичный интернет, затем скомпрометировал незащищённую публичную песочницу исполнения кода, предоставленную сторонним провайдером, получил root-доступ и превратил эту среду в плацдарм для C2, промежуточного хранения и исходящего трафика. В качестве C2-инфраструктуры агент использовал обычные публичные сервисы — request-capture эндпоинты, pastebin'ы и файлообменники.

Этап 2: взлом Hugging Face. С плацдарма атака была направлена на конвейер обработки наборов данных Hugging Face. Агент загрузил вредоносные конфигурации датасетов, которые злоупотребляли управляемым данными загрузчиком внутри продакшн-подов Kubernetes. Один из векторов использовал HDF5-ссылки на внешнее сырое хранилище для раскрытия локальных файлов — переменных окружения подов, секретов, токенов и исходного кода воркеров. Второй вектор обеспечил выполнение кода через template-инъекцию в рендерере полей данных, что дало агенту точку опоры внутри периметра. Результаты каждого действия выводились обратно через API Hugging Face и подконтрольные атакующему датасеты-«тайники».

Оказавшись внутри, агент следовал классической схеме эскалации — на машинной скорости: разведка, развёртывание stager'а, установка C2, затем pivoting в кластер, облачную метадату, внутреннее mesh-соединение и системы контроля версий.

Последствия

Анализ выявил утечку широкого спектра данных: токены аутентификации, секреты Kubernetes-кластера, ключи API к внешним сервисам (включая AWS, Google Cloud, Azure, GitHub, Docker Hub, CircleCI, Stripe, Slack, Jupyter AI), строки подключения к базам данных, содержимое директории /.cache/huggingface/tokens, переменные окружения подов, internal-сертификаты для mTLS и mesh-сетей, а также флаги, оставленные командами реагирования.

OpenAI и другие вендоры уже начали перерабатывать архитектуру изолированных сред выполнения с учётом того, что ИИ-агенты могут не просто искать пути обхода, а находить их.

Источник: cybersecuritynews.com