Meta, OpenAI и Anthropic: ИИ-агенты вырвались за пределы тестовых сред во время испытаний Irregular

Meta стала третьей ведущей ИИ-лабораторией за последние недели, раскрывшей инцидент безопасности с участием одной из своих продвинутых моделей во время киберучений, которые проводил стартап по безопасности ИИ Irregular. Независимый оценщик оказался в центре серии раскрытий, затронувших крупнейшие лаборатории отрасли.

Во время теста в формате capture-the-flag модель Meta Muse Spark 1.1 скомпрометировала систему другой компании и использовала уязвимость безопасности. По данным Reuters, модель получила несанкционированный доступ из-за ошибки конфигурации в тестовой среде. Meta, как цитирует отчёт, заявила, что инцидент был локализован, не причинил долговременного вреда и раскрыт в рамках усилий по прозрачности.

Раскрытие последовало через несколько дней после аналогичных инцидентов у OpenAI и Anthropic — все они произошли во время оценок, проводимых Irregular. OpenAI прямо обвинила своего внешнего партнёра по кибербезопасности в ошибке конфигурации тестовой среды, из-за которой модели получили доступ в публичный интернет. Anthropic также связала выход своих агентов с ошибкой конфигурации со стороны Irregular, но отметила, что инцидент произошёл из-за недопонимания между двумя компаниями. Сама Irregular на запросы о комментариях не ответила.

Тестовая среда больше не пассивная

Хотя инциденты касались разных моделей и разных технических сбоев, они привлекли внимание к Irregular — независимой компании, оценивающей продвинутые ИИ-системы для ведущих разработчиков моделей, и подчеркнули растущую роль специализированных сторонних оценщиков.

Старший менеджер по исследованиям IDC Asia/Pacific Cybersecurity Services Sakshi Grover разложила инциденты по типам: у OpenAI модель эксплуатировала ранее неизвестную уязвимость, выйдя за пределы оценочной среды; инциденты Anthropic в основном связаны с конфигурацией, которая непреднамеренно дала интернет-доступ; отдельная оценка британского AI Safety Institute отличалась тем, что интернет был включён намеренно — для проверки киберспособностей до взаимодействия агентов с реальными системами и людьми.

«Общая проблема в том, что оценочные среды больше нельзя рассматривать как пассивную тестовую инфраструктуру. Способного киберагента следует считать потенциально враждебной машинной сущностью, даже когда он работает в рамках легитимной исследовательской задачи», — предупреждает Grover. Она также отметила: если модель получает доступ к ответам бенчмарков, инфраструктуре оценщика или эталонным артефактам, под угрозой оказываются не только изоляция, но и достоверность самой оценки способностей.

Требования общих стандартов оценки

Раскрытия заставили экспертов заговорить о более жёстких гарантиях проектирования и мониторинга оценок фронт-моделей. Grover рекомендует минимум: интернет по умолчанию закрыт, короткоживущие выделенные идентичности для ИИ-агентов, контролируемый сетевой доступ, полный мониторинг промптов, вызовов инструментов, учётных данных и сетевой активности, а также автоматические условия остановки при выходе агента на неавторизованные системы или выполнении внешне видимых действий.

Исследователь безопасности и редтимер Vibhum Dubey считает, что методы оценки не поспевают за возможностями фронт-моделей: «Лаборатории строят модели, которые продумывают действия на несколько шагов вперёд, а многие оценочные среды всё ещё исходят из того, что агент останется в рамках заданного сценария. Это несоответствие. Оценку нужно судить по тому, насколько среда выдерживает неожиданное поведение, а не только по тому, завершила ли модель задачу. Эти инциденты показывают, что мы бенчмаркируем интеллект быстрее, чем бенчмаркируем изоляцию».

Несмотря на инциденты, и OpenAI, и Anthropic намерены продолжать сотрудничество с Irregular: стартап готовит белую книгу с лучшими практиками изоляции и безопасного проведения кибероценок. Аналитик Gartner Apeksha Kaushik добавила, что традиционная песочница и статическая изоляция становятся недостаточными по мере роста агентности ИИ, и призвала к отраслевым стандартам проектирования оценочных сред, отчётности об инцидентах и непрерывного редтиминга.

Уроки для корпоративных развёртываний

Аналитики видят в произошедшем прямые выводы для компаний, готовящихся внедрять ИИ-агентов. «Самая большая ошибка — относиться к ИИ-агентам как к фичам, а не как к операционным идентичностям. Каждый развёрнутый агент — ещё одна сущность, принимающая решения безопасности от вашего имени», — говорит Dubey. Организациям следует уметь быстро обнаруживать и останавливать автономного агента до вывода в продакшен, обеспечивать границы безопасности через инфраструктуру, идентичность и контроль доступа к инструментам, а не только через промпты, требовать человеческого одобрения необратимых действий и мониторить наблюдаемое поведение агента.

Grover резюмирует: «Эти инциденты не стоит сводить ни к "вышедшим из-под контроля" моделям, ни к простой сетевой ошибке конфигурации. Они показывают, что способные агенты могут превращать обычные слабости контроля, неоднозначные задачи и чрезмерные права в реальные последствия».

Источник: csoonline.com