Trail of Bits: отчёт 1Password об ИИ-патчинге вводит в заблуждение
Отчёт 1Password о патчинге с помощью ИИ вводит в заблуждение
Trail of Bits проанализировала отчёт 1Password об использовании искусственного интеллекта (ИИ) для исправления уязвимостей. Исследование 1Password, опубликованное 6 августа 2026 года, показало, что модели ИИ создают корректные исправления только в 26% случаев. Эта цифра включает эксперименты, где моделям намеренно давали указание применить неверное исправление, а также случаи, когда модели не могли скомпилировать или протестировать свои исправления. Trail of Bits считает, что такой подход искажает реальную картину и может привести к тому, что защитники будут менее эффективно использовать технологии для исправления уязвимостей.
Эксперимент 1Password исказил реальную картину патчинга
Trail of Bits выявила четыре причины, по которым показатель в 26% является вводящим в заблуждение. Во-первых, для исследования был выбран набор из шести сложных уязвимостей, для которых показатели корректных исправлений варьировались от 3% до 60%. Во-вторых, в 22% данных использовались промпты, которые намеренно инструктировали агентов применять неверное исправление. В-третьих, более трети испытаний (36%) запрещали тестирование исправлений, комбинируя их с экспериментами, где тестирование было возможно. В-четвертых, модели GPT-5.5 и Opus 4.8 работали с разными настройками производительности, при этом ни одна модель не была протестирована на максимальных возможностях, и не оценивалось влияние увеличения усилий на результаты. При переанализе данных 1Password, с учётом только тех испытаний, где агенты могли тестировать код и не получали указаний на неверное исправление, 86% (2634 из 3067) исправлений блокировали предоставленный эксплойт. Это демонстрирует полезный патчинг-потенциал в реальных условиях.
Ошибки в оценке и критериях 1Password снижают достоверность отчёта
Отчёт 1Password содержит дополнительные проблемы с инструкциями и оценкой. Критерии остановки и оценки не совпадают: агентов просили остановить работу после победы над эксплойтом, но оценщик проверял уязвимые пути, не затронутые эксплойтом. Оценщик также наказывал за изменения в поведении, которые являлись частью корректного исправления. Автоматическая оценка совпала с человеческой только в 65,9% случаев, а при оценке введения новых ошибок — в 70,5%. Разные модели по-разному оценивали одни и те же исправления в 36,8% случаев. Кроме того, эталонное исправление для Linux содержало уязвимость, которую автоматический оценщик обнаружил лишь в 24 случаях из 248. Хром-градер также принимал неполные исправления, отмечая как корректные патчи, оставляющие уязвимость use-after-free.
Разработчики допускают ошибки в каждом восьмом исправлении
Trail of Bits проанализировала первые предложенные исправления для 2265 уязвимостей в рамках 236 оценок безопасности, проведённых с 2024 по 2026 год. Даже в идеальных условиях, когда разработчики имели подробные отчёты и знали о предстоящей проверке, 12,5% (283 из 2265) первых исправлений не решали проблему полностью. Этот показатель может быть занижен, так как некоторые ошибки исправлялись до формального обзора. В проекте Patch the Planet, совместной инициативе Trail of Bits и OpenAI, из 186 предложенных исправлений 126 (67,7%) были приняты мейнтейнерами. Из них в 91 случае (72,2%) исправление было принято без изменений, связанных с безопасностью. Оставшиеся 60 были закрыты по различным причинам, включая технические.
Новые инструменты для улучшения качества исправлений
Trail of Bits выпускает два новых инструмента для агентов: post-patch-validation и review-walkthrough. Post-patch-validation помогает агентам выявлять неполные исправления и регрессии до отправки патча на проверку. Он включает воспроизведение исходной ошибки, проверку других путей к сбою и тестирование исправлений. Review-walkthrough предназначен для помощи инженерам в проверке изменений кода. Эти инструменты призваны повысить надёжность и эффективность процесса исправления уязвимостей с помощью ИИ.
Источник: Trail of Bits