главное в кибербезопасности Читать в канале
Атаки и утечки 21 сентября 2026 5 мин

Атаки на ИИ-агентов: отравленные навыки и внедрение подсказок

Атаки на ИИ-агентов используют уязвимости в навыках и подключенных инструментах

Искусственный интеллект (ИИ) становится новой поверхностью атаки. Исследования февраля 2026 года описывают полный цикл угроз для ИИ-агентов, включая отравленные навыки, внедрение подсказок и атаки через подключенные инструменты. Целью злоумышленников становится не сама модель ИИ, а агент, который может выполнять действия. Исследования фокусируются на реальных путях атак через агентов, их навыки, протоколы и связанные среды. Агент обладает постоянной памятью, цепочкой поставок навыков и инструментов, протоколами для подключения к внешним сервисам и возможностью выполнять действия в системах пользователя. Каждая из этих составляющих представляет собой поверхность атаки.

ИИ-агенты проводят разведку для деанонимизации пользователей

Первый этап атаки — сбор информации о цели. Исследования показывают, что разведка стала задачей для ИИ. Работа Николаса Карлини и Флориана Трамера демонстрирует крупномасштабную деанонимизацию с использованием ИИ-агента. Этот процесс извлекает сигналы, связанные с личностью, из текста, находит потенциальные совпадения и проверяет их. Это ставит под сомнение идею «практической анонимности», согласно которой среди миллиардов людей человек остается анонимным. Такая разведка масштабируется до промышленных объемов и нацелена на людей, а не только на системы. Это дает злоумышленникам инструмент для соединения разрозненных фрагментов информации в профиль с такой скоростью и масштабом, которые недоступны человеку-аналитику.

Цепочка поставок ИИ-агентов подвержена отравленным навыкам и инструментам

Наиболее значимая область исследований февраля 2026 года — цепочка поставок ИИ-агентов. Она открывает поверхность атаки, которой не существовало ранее. Эмпирическое исследование почти 98 380 навыков выявило 157 вредоносных. Они разделены на два типа: похитители данных и угонщики агентов. Эти атаки использовали многоэтапные цепочки и изощренные методы сокрытия, включая маскировку вредоносного поведения в документации навыка. Для мира агентов это эквивалент первых крупных случаев вредоносных пакетов в репозиториях программного обеспечения. Два других исследования подтверждают атакующий потенциал. Один бенчмарк показывает, что агенты выполняют вредоносные действия при установке скомпрометированного навыка. Другой фреймворк демонстрирует автоматизацию скрытого внедрения через обратную связь. Четвертое исследование нацелено на протокол Model Context Protocol (MCP), который агенты используют для подключения к внешним инструментам и данным, и предлагает безопасную архитектуру, поскольку текущая небезопасна. Инструмент, которому доверяет пользователь, становится оружием, имеющим доступ к файлам, электронной почте и системам.

Внедрение подсказок автоматизировано и нацелено на получение доступа и выполнение кода

Внедрение подсказок (prompt injection) остается распространенной техникой. Исследования февраля 2026 года показывают, что она перестала быть ручным процессом. Одно исследование использует обучение с подкреплением для автоматического поиска строк внедрения, которые манипулируют поведением агента, сохраняя видимость легитимной задачи. Другое — фреймворк адаптивного тестирования для веб-агентов — идентифицирует поверхности внедрения из трассировок выполнения и автоматически обнаруживает многоэтапные атаки. Систематический обзор создает полную таксономию этих техник. Примерами являются EchoLeak (CVE-2025-32711), который позволил извлечение данных из Copilot без участия пользователя через внедрение подсказок, и CurXecute (CVE-2025-54135/54136), который позволил удаленное выполнение кода через реализацию MCP в IDE. Разрыв между публикацией исследования и уязвимостью с идентификатором CVE теперь измеряется неделями.

Обход защит модели осуществляется структурными методами и через взлом

Исследования продолжают фокусироваться на самой модели ИИ. Некоторые защиты являются структурными и могут быть обойдены структурно. Одно исследование представляет автоматизированный взлом (jailbreak), который использует обратную связь от фильтров безопасности для уточнения подсказок без внутреннего доступа к модели. Другое выявляет систематическую уязвимость в моделях с открытым весом к атакам предварительного заполнения (prefill attacks), которые манипулируют состоянием контекста для обхода защит. Третье исследование показывает, что в моделях mixture-of-experts (MoE) поведение безопасности сосредоточено в небольшом числе «экспертов». Их отключение может привести к широкому отказу защитных механизмов модели. Для обнаружения скрытых взломов предлагается отделять цель от лингвистической обертки внутри внутренних представлений модели.

Последствия атак включают компрометацию систем и распространение вредоносного поведения

Этот этап отличает «модель сказала что-то не то» от «агент сделал что-то не то с вашими системами». Исследование с использованием красной команды поместило автономных агентов в реальную среду с постоянной памятью, доступом к электронной почте, Discord, файловой системе и выполнению команд оболочки. В одиннадцати случаях зафиксированы: выполнение команд неавторизованного лица, раскрытие конфиденциальной информации, деструктивные действия, отказ в обслуживании, неконтролируемое потребление ресурсов, выдача себя за другое лицо, распространение небезопасных практик между агентами и частичный захват системы. Особую обеспокоенность вызывает междоменное распространение вредоносного поведения между агентами через общую память и диалоги. Когда участниками становятся не только люди, но и агенты, поверхность атаки перестает быть суммой отдельных систем, а становится сетью.

Использование карты MITRE ATLAS для защиты ИИ-агентов

Карта MITRE ATLAS теперь включает техники, связанные с агентами, охватывая весь цикл атаки: от ИИ-ассистированной разведки и отравленных цепочек поставок до внедрения подсказок, взломов и воздействия на системы. Идентификаторы ATLAS работают аналогично идентификаторам ATT&CK, например, AML.T0051 рядом с T1557, и интегрируются в существующие процедуры и правила обнаружения. Это создает общий язык для реагирования на инциденты с ИИ, аналогичный тому, что используется для традиционных угроз.

Инвентаризация, проверка навыков и мониторинг действий агентов необходимы для защиты

Для защиты ИИ-агентов необходимы три критически важных шага. Первый — инвентаризация: необходимо знать обо всех агентах, навыках и серверах MCP. Второй — отношение к навыкам и инструментам как к цепочке поставок: их нужно проверять, запускать в песочницах, закреплять версии и отслеживать. Третий — наблюдение за действиями агента, а не только за его словами. Наиболее влиятельные техники, включая вызов инструментов и извлечение данных, могут не проявляться как единичное подозрительное сообщение, а как поведенческие отклонения и аномалии в вызовах инструментов. Для обнаружения такой активности требуется телеметрия времени выполнения, охватывающая подсказки, состояние контекста и вызовы инструментов, с базовым уровнем для каждого агента. Этого уровня обнаружения сегодня почти ни у кого нет.

Опубликовано в канале 21 сентября, 12:04

Каждый материал сайта выходит в канале в тот же момент.

Источник: Security Affairs