Создан алгоритм для автопоиска уязвимостей в нейросетях автопилотов
Специалисты Санкт-Петербургского государственного электротехнического университета «ЛЭТИ» разработали способ автоматизированного поиска уязвимостей в нейросетях, применяемых в системах компьютерного зрения. Решение может использоваться для проверки моделей, задействованных в беспилотном автомобильном и воздушном транспорте, сообщается на сайте СПбГЭТУ «ЛЭТИ».
Разработчики сформировали единую базу инструментов, предназначенных для обнаружения слабых мест в моделях компьютерного зрения. Кроме того, ученые создали эволюционный алгоритм, который самостоятельно перебирает различные сочетания методов, меняет их параметры и определяет наиболее результативную конфигурацию для проверки конкретной нейросети.
Как пояснила руководитель лаборатории фундаментальных основ построения интеллектуальных систем Алла Левина, такой подход позволяет отказаться от ручного подбора вариантов проверки. Алгоритм самостоятельно ищет комбинации, способные выявить уязвимости используемой модели.
Системы автоматического управления транспортом применяют компьютерное зрение для распознавания и классификации окружающих объектов. Одной из потенциальных угроз для таких решений являются специально измененные изображения. Внесенные в них искажения могут быть практически незаметны человеку, однако способны заставить нейросеть неверно определить объект. В частности, система может ошибиться при распознавании дорожного знака.
При традиционном подходе специалисты проверяют устойчивость моделей вручную, последовательно применяя различные варианты воздействия. Такой процесс требует значительных затрат времени и не позволяет систематически проверить все возможные сочетания методов.
Ученые ЛЭТИ разделили процедуру поиска уязвимостей на шесть функциональных частей. Подбор наиболее эффективных комбинаций был преобразован в задачу оптимизации «черного ящика». Для ее решения исследователи использовали байесовскую оптимизацию и специально созданный эволюционный алгоритм.
Эффективность разработки проверили на собственной модели компьютерного зрения, обученной с использованием крупной базы данных. Исследователи учитывали долю случаев, когда нейросеть удавалось ввести в заблуждение, а также то, насколько заметными оставались внесенные в изображение изменения.
При испытаниях обычный алгоритм оказался успешным в 13% случаев на выборке из тысячи изображений. Подобранный новой системой вариант повысил этот показатель до 58%. Одновременно степень визуальных искажений удалось уменьшить примерно на 15%. По словам младшего научного сотрудника лаборатории Романа Радионова, для человека такие изменения выглядят как небольшой шум на многократно пересохраненной фотографии.
Разработчики рассчитывают, что созданный инструмент можно будет применять при аудите безопасности нейросетей. Он позволит еще до внедрения модели обнаруживать наиболее серьезные уязвимости и устранять их.



