главное в кибербезопасности Читать в канале
Технологии 8 октября 2026 1 мин

AgentTracer отслеживает атаки косвенной инъекции промптов в LLM-агентах

AgentTracer выявляет атаки косвенной инъекции промптов

Разработчики представили AgentTracer — фреймворк для отслеживания атак косвенной инъекции промптов (indirect prompt injection, IPI) в больших языковых моделях (LLM). LLM-агенты взаимодействуют с внешними ресурсами для выполнения задач. Это делает их уязвимыми для IPI, когда злоумышленники перенаправляют агентов на выполнение вредоносных инструкций. Существующие методы отслеживания фокусируются на явных зависимостях потоков управления и данных. Они упускают неявные связи между вызовами инструментов, вызванные вредоносной инструкцией. Такие вызовы могут не иметь явных зависимостей и перемешиваться с легитимными операциями. Это затрудняет полную реконструкцию цепочки атаки.

AgentTracer восстанавливает неявные зависимости между вызовами инструментов

AgentTracer рассматривает IPI как отклонение цели задачи (task intent drift). Фреймворк восстанавливает неявные зависимости решений между вызовами инструментов. Он строит Intent-Driven Execution Graph, который связывает разрозненные вызовы инструментов по цели задачи. AgentTracer объединяет пользовательский запрос с базой знаний об операциях. Это позволяет построить пространство авторизации пользовательских намерений и идентифицировать вызовы инструментов с отклонением от цели. Начиная с аномального вызова инструмента, AgentTracer выполняет целевое отсечение и обратное отслеживание. Это позволяет реконструировать цепочку атаки и определить источник и точку инъекции.

AgentTracer достигает 94% точности определения точки инъекции

Для оценки AgentTracer в условиях шума от нормальных задач использовались журналы выполнения. Они были построены из успешных IPI-атак в AgentDyn и InjecAgent. Также были добавлены нормальные журналы выполнения, содержащие 1800 пользовательских запросов и 9000 фоновых вызовов инструментов без IPI. В экспериментах AgentTracer показал 94,17% точности определения точки инъекции и 93,56% точности восстановления пути атаки. Сравнительные тесты показали, что AgentTracer повышает точность определения точки инъекции по сравнению с существующими методами на 18–54%.

Источник: arXiv / безопасность ИИ