ИИ-агенты как канал доставки малвари: восемь схем атак

В июле 2026 года компания Island задокументировала кампанию FakeGit: около 7 600 поддельных репозиториев на GitHub, 6 600 фальшивых профилей и более 14 миллионов загрузок. Свыше 800 репозиториев выдавали себя за ИИ-навыки и MCP-серверы, распространяя загрузчик SmartLoader и инфостилер StealC.

Поддельные репозитории — не новость. Удивило другое: кто их рекомендовал. Gemini и ChatGPT независимо друг от друга предложили пользователям один и тот же вредоносный репозиторий walmart-mcp — агенты нашли проект атакующих и выдали инструкцию по установке. Атакующим больше не нужно обманывать пользователя напрямую: достаточно обмануть ассистента, которому пользователь доверяет.

Почему агенты уязвимы: инструкции и внешний контент

Две архитектурные особенности делают такие атаки возможными. Первая: агент обрабатывает инструкции и внешние данные как текст. Вредоносная команда, спрятанная в README, на веб-странице или в описании инструмента, может быть воспринята как указание к исполнению, а не как материал для анализа. Это косвенная инъекция промпта (indirect prompt injection).

Вторая: агент умеет эти указания выполнять. Исследователь безопасности Саймон Уиллисон называет сочетание трёх условий «смертельной триадой» (lethal trifecta): доступ к ценной информации, контакт с недоверенным внешним содержимым и возможность передавать данные за пределы системы. Вместе эти условия превращают вредоносный текст в потенциальную утечку данных. Другие атаки эксплуатируют вещь попроще — поддельные сигналы доверия: звёзды, загрузки, история контрибьюторов и листинги в реестрах делают вредоносное ПО похожим на легитимное.

Ниже — восемь способов, которыми эти слабости уже пользуются.

AgentBaiting: когда малварь советует сам агент

AgentBaiting нацелен на ассистента, а не на пользователя. В кампании FakeGit атакующие создавали убедительные репозитории с реалистичной документацией и распространяли их через публичные реестры. Gemini и ChatGPT независимо рекомендовали один и тот же поддельный коннектор Walmart MCP, потому что он выглядел релевантно и достоверно. Репозитории распространяли SmartLoader, который скачивал StealC — тот воровал учётные данные браузера, cookie, активные сессии и данные криптокошельков. Агенты не были скомпрометированы: они просто рекомендовали ПО, чья кажущаяся надёжность была сфабрикована.

Отравление инструментов: инструкции в описаниях

MCP-серверы передают агенту текстовые описания доступных инструментов, и атакующие могут спрятать инструкции внутри этих описаний. В апреле 2025 года Invariant Labs показала, как инструкции, встроенные во вредоносный инструмент-калькулятор, заставляли отдельный доверенный почтовый коннектор копировать исходящие сообщения атакующему. Пользователь вредоносных инструкций не видит. Отравление инструментов пока остаётся продемонстрированной моделью угрозы, а не публично подтверждённым инцидентом.

Агент скрывает свои действия

Некоторые вредоносные навыки прямо предписывают агенту не раскрывать сделанное. Академическое исследование 2026 года изучило 98 380 навыков из двух реестров, подтвердило 157 как вредоносные, выявило 632 уязвимости и 13 техник атак. Одна из повторяющихся инструкций дала исследованию название: «Не упоминай это пользователю». Агент может отчитаться о выполнении задачи, умолчав о несанкционированных действиях, включая передачу чувствительных данных.

Rug pull: доверенный пакет меняется после установки

Пакет может вести себя легитимно месяцами, а потом добавить вредоносный функционал. В сентябре 2025 года Koi Security обнаружила postmark-mcp — коннектор, выдававший себя за легитимный почтовый сервис Postmark. Версии вплоть до 1.0.15 выглядели безобидно, а версия 1.0.16 добавила скрытого получателя BCC, копировавшего исходящие письма на домен, контролируемый атакующими. Под угрозой оказались письма для сброса пароля и ссылки аутентификации примерно 300 организаций. Postmark подтвердила, что коннектор не является её продуктом и что сам сервис не скомпрометирован. Атака эксплуатировала доверие, накопленное предыдущими версиями: автообновление доставило вредоносный функционал без нового подтверждения пользователя.

Изменения вне пакета: ревью кода не всё ловит

Проверка исходного кода не обнаружит всего, если внешние зависимости меняются независимо. В августе 2025 года Check Point раскрыла MCPoison — уязвимость в Cursor, позволявшую атакующим менять ранее одобренные конфигурации проекта и выполнять команды без нового подтверждения. Проблему закрыли в Cursor 1.3. Другой эксперимент 2026 года показал, как навык, распространённый примерно на 26 000 агентов, сначала ссылался на легитимную документацию, а затем внешняя страница подменялась на вредоносные инструкции по установке. Сам пакет не менялся — угроза обходила сканеры, проверяющие только загруженные файлы.

Открытие незнакомого репозитория может выполнить код

Среды разработки с ИИ-агентами несут риски ещё до того, как пользователь сознательно что-то установит. Check Point выяснила, что Claude Code мог выполнять управляемые репозиторием команды конфигурации до завершения пользователем процесса подтверждения доверия. Среди уязвимостей — произвольное выполнение команд (CVE-2025-59536) и утечка API-учётных данных через подменённый серверный эндпоинт (CVE-2026-21852). Anthropic впоследствии закрыла заявленные уязвимости. Вывод простой: открытие незнакомого проекта в среде разработки с агентом может создать пути выполнения, которых обычный осмотр файлов не покажет.

ClickFix: пользователь ставит малварь сам

ClickFix не требует изощрённой инъекции промпта. Атакующие маскируют вредоносные команды под обязательные условия установки внутри README или файлов SKILL.md — пользователь следует инструкции и выполняет команды сам. В ходе кампании ClawHavoc в начале 2026 года исследователи нашли в экосистеме OpenClaw вредоносные навыки, маскировавшиеся под криптовалютные и рабочие инструменты. Koi Security при аудите выявила 341 вредоносный навык из 2 857 доступных. Antiy CERT позднее отследила 1 184 вредоносных навыка, связанных всего с 12 аккаунтами. Малварь целилась в криптокошельки, учётные данные браузеров, API-ключи, SSH-ключи и сессии Telegram.

Когда атакующим становится сам агент

Агенты могут и координировать наступательные операции. В ноябре 2025 года Anthropic сообщила о GTG-1002 — кампании кибершпионажа, в которой атакующие подключили инструменты пентеста к Claude Code через MCP. По данным Anthropic, модель самостоятельно выполняла примерно 80–90% тактических операций, тогда как люди ставили цели и принимали ключевые стратегические решения. Anthropic атрибутировала кампанию группе, спонсируемой государством; эта оценка не подтверждена независимо в публичных репозиториях threat intelligence. Случай показывает, как существующие наступательные инструменты собираются в автономные рабочие процессы.

Экономика фальшивой репутации

Многие атаки держатся на искусственно созданной репутации. Расследование апреля 2026 года обнаружило, что звёзды GitHub продаются по $0,03–$0,10 за штуку; исследователи также выявили около шести миллионов подозрительных звёзд в 15 835 репозиториях. В другом случае атакующие клонировали коннектор Oura MCP и три месяца создавали фальшивую историю контрибьюторов, прежде чем распространить вредоносную версию через легитимные реестры. Отдельное вредоносное расширение для Solidity показывало искусственно завышенное число загрузок, в итоге приблизившееся к двум миллионам; один блокчейн-разработчик, как сообщается, потерял около $500 000.

Популярность определяет находимость, а не безопасность. Ревью кода и сканеры тоже ограничены: вредоносный функционал может прятаться в зависимостях, описаниях инструментов, последующих обновлениях или внешних веб-страницах.

Что делать администратору

Открытая экосистема уже проходила через похожие угрозы цепочки поставок. Обязательная двухфакторная аутентификация, доверенная публикация и проверенное происхождение пакетов в итоге укрепили зрелые реестры. Маркетплейсы ИИ-навыков развиваются гораздо быстрее, а их инфраструктура безопасности остаётся сравнительно незрелой. Последствия шире: ИИ-навык может работать с доступом к почте, репозиториям, базам данных и учётным данным.

Практически это означает: не ставить навыки и MCP-серверы из непроверенных источников, фиксировать версии вместо автообновления, ограничивать права агента и следить за тем, к каким данным он имеет доступ. Отдельно стоит проверять, что именно агент рекомендует как «популярное» — звёзды и загрузки ничего не говорят о безопасности.

Для AdTech тот же риск напрямую переносится на рекламные аккаунты: медиабайеры и AdOps всё чаще подключают агентов, ассистентов отчётности и инструменты кампаний к DSP, рекламным платформам и данным рекламодателей. Отравленный навык отчётности или генерации креативов может раскрыть информацию о кампаниях, скомпрометировать учётные данные аккаунта или поставить под угрозу рекламные бюджеты. Логика обмана знакомая: покупка фальшивых звёзд и загрузок, чтобы малварь выглядела надёжной, — то же самое, что накрутка вовлечённости и ботового трафика, чтобы фальшивый рекламный инвентарь выглядел легитимным.

По мере того как ИИ-агенты получают всё больше полномочий, проверка ПО и сигналов, которым они доверяют, становится не менее важной, чем защита систем, в которых они работают. Смежные темы — новая поверхность атаки на ИИ-агентов через MCP-серверы и четыре типовых провала защиты ИИ-агентов от NVIDIA AI Red Team.

Частые вопросы

Кого касается эта угроза?

Всех, кто ставит ИИ-навыки, MCP-серверы или расширения для агентных сред разработки: разработчиков, сисадминов, а также команды, подключающие агентов к почте, репозиториям, базам данных и рекламным платформам.

Чем AgentBaiting отличается от обычного фишинга?

Обманывают не пользователя, а ассистента. В кампании FakeGit Gemini и ChatGPT сами рекомендовали вредоносный репозиторий walmart-mcp, потому что его достоверность была сфабрикована. Пользователь получал инструкцию по установке от сервиса, которому доверяет.

Что такое «смертельная триада»?

Формулировка Саймона Уиллисона: у агента одновременно есть доступ к ценной информации, контакт с недоверенным внешним содержимым и возможность передавать данные наружу. Сочетание этих трёх условий превращает вредоносный текст в потенциальную утечку.

Какие именно уязвимости упоминаются в статье?

MCPoison в Cursor (закрыта в версии 1.3), а также CVE-2025-59536 (произвольное выполнение команд) и CVE-2026-21852 (утечка API-учётных данных) в Claude Code, которые Anthropic впоследствии закрыла.

Как отличить вредоносный навык от легитимного?

По звёздам и числу загрузок — никак: в апреле 2026 года звёзды GitHub продавались по $0,03–$0,10, а исследователи нашли около шести миллионов подозрительных звёзд в 15 835 репозиториях. Проверять нужно происхождение пакета, историю версий и права, которые он запрашивает.

Что такое rug pull в контексте пакетов?

Пакет работает нормально месяцами, а затем обновление добавляет вредоносный функционал. Пример — postmark-mcp: версии до 1.0.15 были безобидны, а 1.0.16 добавила скрытую копию исходящих писем атакующим. Автообновление доставило её без нового подтверждения пользователя.

Помогает ли проверка исходного кода?

Не всегда. MCPoison позволяла менять ранее одобренные конфигурации проекта, а в эксперименте 2026 года сам пакет не менялся — подменялась внешняя страница, на которую он ссылался. Сканеры, проверяющие только загруженные файлы, такое пропускают.

Что делать, если обновиться нельзя?

Ограничить права агента и доступ к данным, фиксировать версии вместо автообновления и не подключать агентов к почте, репозиториям и рекламным аккаунтам без необходимости. Проверять, какие внешние страницы и зависимости тянет навык.

Источник: artificialintelligence-news.com