Mantis от Google: набор навыков для ИИ-агентов, которые ищут и правят уязвимости

Google выложила в открытый доступ Mantis — набор навыков для проверки безопасности, который превращает обычного ИИ-агента в исполнителя полного цикла работы с уязвимостями. Агент находит подозрительное место, отсеивает ложные срабатывания, воспроизводит баг в песочнице, пишет минимальный патч, заново атакует уже исправленный код и выставляет остаточный риск по шкале от 1 до 10.

Ключевое отличие от сканера: Mantis не запускается по репозиторию «и на этом всё». Это набор слэш-команд, которые загружает уже имеющийся у вас кодирующий агент, плюс жёсткие правила о том, где этому агенту разрешено исполнять код.

Что уже можно, а что пока нет

Развернуть Mantis локально и использовать для внутренней оценки — можно уже сегодня: клонируйте репозиторий и запускайте с Gemini CLI, Antigravity CLI, Google ADK или любым сопоставимым агентным фреймворком. Для продакшена инструмент пока не рекомендуется. Код распространяется под лицензией Apache 2.0, и это не поддерживаемый продукт Google, а открытый набор навыков.

Конвейер: от истории коммитов до отчёта

Каждый этап Mantis публикуется как отдельная директория навыка, вызывается слэш-командой и выстраивается в цепочку. Есть управляющий навык /mantis-meta-agent, который способен прогнать весь цикл в рамках одной длительной сессии.

Ранние стадии изучают цель:

  • /mantis-history — ищет в истории системы контроля версий прошлые исправления безопасности;
  • /mantis-summarize — пишет карты директорий;
  • /mantis-architecture — собирает базу знаний в формате Markdown;
  • /mantis-threat-model — выводит границы доверия;
  • /mantis-plan — формирует адресный план работ.

Средние стадии ищут и фильтруют:

  • /mantis-researcher — проходит по файлам согласно плану;
  • /mantis-dedupe, /mantis-review и /mantis-critic — схлопывают дубликаты, применяют негативные правила и отбрасывают проблемы, которые не могут возникнуть в релизной сборке.

Поздние стадии доказывают и чинят:

  • /mantis-reproduce — исполняет полезную нагрузку в gVisor или виртуальной машине с отключённой сетью;
  • /mantis-chain — собирает многошаговые цепочки эксплуатации из отдельных подтверждённых находок;
  • /mantis-patch — применяет и проверяет исправление;
  • /mantis-calibrate — присваивает оценку риска от 1 до 10;
  • /mantis-reflect — записывает выводы для следующего прохода;
  • /mantis-report — формирует читаемый человеком пакет проверки.

Отдельный навык /mantis-advise переворачивает поток: он обращается к накопленной модели угроз, прошлым линиям багов и проверенным шаблонам патчей ещё до того, как вы напишете код, — чтобы один и тот же класс ошибки не появился дважды.

Почему это важно

Большинство агентных инструментов безопасности останавливаются на этапе генерации находок. Интерес Mantis в другом: границей доверия здесь служат воспроизведение и повторная атака, а не уверенность языковой модели. Кроме того, Google публикует контракты между стадиями — команды могут обернуть навыки в детерминированную обвязку вместо того, чтобы доверять LLM оркестрацию shell-команд.

По данным Google, иерархическое дерево суммаризации сокращает накладные расходы на токены более чем на 85 процентов. Проблему, которую решает Mantis, вендор описывает так: у наивного ИИ-сканирования кода доля истинно положительных срабатываний — менее 7 процентов.

Что это значит для российской практики

Mantis — открытый код под Apache 2.0, поэтому формальных препятствий для локального развёртывания нет: всё работает на вашем железе, без обращений к внешним сервисам, если вы сами выбрали такой режим. Для команд, которые уже применяют ИИ-агентов в разработке, это способ добавить к ним проверку безопасности без покупки отдельного сканера — так же, как это делают с другими открытыми агентными инструментами, например с генератором юнит-тестов code-testing-generator от Microsoft. Но помните о статусе: инструмент не поддерживается Google как продукт и не рекомендован для продакшена — начинайте с внутренних репозиториев и оценки на тестовых проектах. Если агент запускается в длительной сессии и пишет код сам, пригодится и рантайм Shepherd с откатом агентных запусков. Отдельно стоит взвесить, допустимо ли отправлять содержимое кода во внешнюю модель, если вы используете облачный агент, а не локальный.

Частые вопросы

Кого касается эта новость?

Команд разработки, которые уже используют ИИ-агентов для работы с кодом и хотят добавить к ним проверку безопасности. Инструмент не заменяет сканер и не является продуктом Google с поддержкой.

Это готовый к продакшену инструмент?

Нет. Google прямо указывает: локальное и внутреннее развёртывание — да, продакшен — пока нет.

Какие агентные фреймворки поддерживаются?

Gemini CLI, Antigravity CLI, Google ADK и любые сопоставимые агентные фреймворки.

Под какой лицензией распространяется Mantis?

Apache 2.0.

Чем Mantis отличается от обычного сканера уязвимостей?

Сканер выдаёт находки. Mantis доводит дело до воспроизведения бага в песочнице, патча и повторной атаки на исправленный код — именно это, а не уверенность модели, здесь считается границей доверия.

Как обеспечивается безопасность при воспроизведении уязвимости?

Навык /mantis-reproduce исполняет полезную нагрузку в gVisor или виртуальной машине с отключённой сетью.

Что такое /mantis-advise?

Это навык, который работает в обратную сторону: перед написанием кода он обращается к накопленной модели угроз, прошлым линиям багов и проверенным шаблонам патчей, чтобы не допустить повторения уже известного класса ошибок.

Как оценивается риск найденной уязвимости?

Навык /mantis-calibrate присваивает оценку от 1 до 10.

Насколько Mantis экономит токены?

По данным Google, иерархическое дерево суммаризации сокращает накладные расходы на токены более чем на 85 процентов.

Какую проблему решает Mantis?

Google указывает, что у наивного ИИ-сканирования кода доля истинно положительных срабатываний — менее 7 процентов. Mantis нацелен именно на эту проблему.

Где взять код?

Репозиторий google/mantis на GitHub; там же доступны Agent Reference Guide и руководство по началу работы.

Источник: marktechpost.com