OpenAI показала GPT-Red: ИИ-атакующий обошёл людей на промпт-инъекциях со счётом 84 против 13

OpenAI рассказала о GPT-Red — внутренней системе автоматического «красного тиминга», которая ищет уязвимости в её же языковых моделях. Идея в том, чтобы не полагаться только на живых тестировщиков: модель-атакующий сама находит бреши через итеративные состязательные атаки.

Цифры, которые впечатляют

Против GPT-5.1 разрыв с людьми получился разгромным:

  • GPT-Red — 84% успеха на сценариях непрямой промпт-инъекции;
  • живые red-team-специалисты — 13% на тех же сценариях;
  • атака «поддельная цепочка рассуждений» (Fake Chain-of-Thought) — более 95% успеха против GPT-5.1.

Против ранней GPT-5 (август 2025) срабатывало больше 90% атак GPT-Red.

Как защита догоняла

На более новой GPT-5.6 Sol картина заметно улучшилась:

  • эффективность «поддельной цепочки рассуждений» упала ниже 10%;
  • доля провалов при прямой промпт-инъекции — 0,05%, это в 6 раз меньше, чем у продакшн-модели четырьмя месяцами ранее;
  • против GPT-5.6 срабатывало уже менее 23% атак.

Как это обучали

GPT-Red учат через self-play — обучение с подкреплением в режиме игры против самого себя. Атакующий пытается протолкнуть вредоносный промпт, а модели-защитники должны и отбиться, и при этом выполнить поставленную задачу. Награда устроена так, чтобы защитник не мог просто отказаться отвечать на всё подряд.

Новый класс атак и примеры из практики

По ходу дела система нашла ранее неизвестный приём — Fake Chain-of-Thought: в вывод подсовываются поддельные записи «рассуждений», которые целевая модель принимает за проверенные факты и действует по ним.

Проверяли и на агентах. Агента торгового автомата удалось заставить менять цены, добавлять несанкционированные товары и отменять заказы клиентов. Агент Codex CLI под давлением GPT-Red эффективнее базовых методов сливал данные — на десяти отложенных сценариях.

Ограничения

OpenAI честно признаёт: с многошаговыми атаками и атаками через изображения GPT-Red пока справляется не полностью — тут по-прежнему нужен человек. Модель остаётся сугубо внутренней и публично выпускаться не будет.