JailBreak-атаки на LLM: как обмануть ИИ ролевыми играми
JailBreak-атаки обходят ограничения ИИ через ролевые игры
JailBreak представляет собой состязательную атаку, которая обходит встроенные механизмы безопасности и ограничения больших языковых моделей (LLM). Цель атаки — индуцировать модель к генерации запрещенных или вредоносных ответов, противоречащих политике использования и общественным нормам. Атака достигается путем разработки специальных промптов, часто с использованием ролевых игр или уловок. В отличие от промпт-инъекции, где вредоносная команда приходит извне, при JailBreak вредоносную команду подает сам пользователь напрямую. Нейросети, обладая доступом к огромным объемам данных, могут генерировать нежелательный контент, если их не ограничивать. Разработчики LLM начали внедрять правила безопасности, но пользователи нашли способы их обходить.
DAN-exploit и эксплойт «Бабушка» заставляют ИИ играть роли
DAN (Do Anything Now) — один из первых известных джейлбрейков для ChatGPT. Пользователь предлагал модели «сыграть роль» альтернативного персонажа без правил и ограничений. Например, модель просили притвориться Дэном, который «теперь может делать все что угодно». В таком режиме нейросеть выполняла запросы, которые в обычном состоянии отклоняла, например, предоставляла рецепт «коктейля Молотова». Эксплойт «Бабушка» использовал эмпатию модели. Пользователь просил модель сыграть роль покойной бабушки-инженера-химика, которая рассказывала внуку о производстве напалма. Модель, «войдя в образ» и стремясь помочь, пересказывала технологический процесс, воспринимая отказ как вред. Похожий прием — использование художественного текста, где незаконное действие описывается как часть вымышленного сюжета.
Атака Crescendo и кодирование обходят фильтры безопасности LLM
Исследователи Microsoft описали атаку Crescendo, которая работает в несколько этапов. Атакующий постепенно подводит модель к выдаче нужной информации через серию невинных вопросов, используя предыдущие валидные ответы как контекст. Например, прямой запрос о создании «коктейля Молотова» модель отклонит, но цепочка вопросов об истории и применении этого оружия может привести к детальному описанию его изготовления. Другой метод — взлом с помощью кодирования. Запрос, закодированный, например, в Base64, может обойти фильтры безопасности, которые анализируют текст. Модель распознает кодировку, декодирует инструкцию и выполняет ее, иногда в обход ограничений. Инструкцию можно также спрятать в изображении с помощью стеганографии, записывая текст в младшие биты пикселей, что минимально меняет внешний вид картинки.
Опубликовано в канале 21 сентября, 18:06
Каждый материал сайта выходит в канале в тот же момент.
Источник: Selectel