OpenAI рассказала о GPT-Red — внутренней системе автоматического «красного тиминга», которая ищет уязвимости в её же языковых моделях. Идея в том, чтобы не полагаться только на живых тестировщиков: модель-атакующий сама находит бреши через итеративные состязательные атаки.
Цифры, которые впечатляют
Против GPT-5.1 разрыв с людьми получился разгромным:
- GPT-Red — 84% успеха на сценариях непрямой промпт-инъекции;
- живые red-team-специалисты — 13% на тех же сценариях;
- атака «поддельная цепочка рассуждений» (Fake Chain-of-Thought) — более 95% успеха против GPT-5.1.
Против ранней GPT-5 (август 2025) срабатывало больше 90% атак GPT-Red.
Как защита догоняла
На более новой GPT-5.6 Sol картина заметно улучшилась:
- эффективность «поддельной цепочки рассуждений» упала ниже 10%;
- доля провалов при прямой промпт-инъекции — 0,05%, это в 6 раз меньше, чем у продакшн-модели четырьмя месяцами ранее;
- против GPT-5.6 срабатывало уже менее 23% атак.
Как это обучали
GPT-Red учат через self-play — обучение с подкреплением в режиме игры против самого себя. Атакующий пытается протолкнуть вредоносный промпт, а модели-защитники должны и отбиться, и при этом выполнить поставленную задачу. Награда устроена так, чтобы защитник не мог просто отказаться отвечать на всё подряд.
Новый класс атак и примеры из практики
По ходу дела система нашла ранее неизвестный приём — Fake Chain-of-Thought: в вывод подсовываются поддельные записи «рассуждений», которые целевая модель принимает за проверенные факты и действует по ним.
Проверяли и на агентах. Агента торгового автомата удалось заставить менять цены, добавлять несанкционированные товары и отменять заказы клиентов. Агент Codex CLI под давлением GPT-Red эффективнее базовых методов сливал данные — на десяти отложенных сценариях.
Ограничения
OpenAI честно признаёт: с многошаговыми атаками и атаками через изображения GPT-Red пока справляется не полностью — тут по-прежнему нужен человек. Модель остаётся сугубо внутренней и публично выпускаться не будет.