технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Tuesday, September 29, 2026
Атаки на приватные данные
Объяснения в машинном обучении раскрывают поведение модели за пределами прогнозов, создавая поверхности атаки для обеспечения конфиденциальности модели
и защиты данных. Мы систематизируем 25 исследований, которые используют объяснения для извлечения модели, вывода принадлежности и инверсии модели, рассматривая вывод атрибутов как частичную инверсию. Существующие работы часто маркируются только как «черный» или «белый ящик», скрывая существенные различия в том, какой сигнал объяснения достигает противника. Поэтому мы разделяем знания модели и получение объяснений и выделяем пять путей: раскрытие со стороны цели, получение со стороны злоумышленника, вторичное раскрытие, привилегированный доступ и раскрытие глобальных артефактов. На этих путях объяснения снижают затраты на извлечение, раскрывают сигналы принадлежности с помощью статистики объяснений, расстояния доступа, и управляемой объяснениями устойчивости, а также поддерживают пространственную или алгебраическую реконструкцию частных входных данных. Мы сравниваем системные и модели угроз, сигналы объяснений, вспомогательные знания, целевые модели, модальности, бюджеты запросов, метрики оценки, сообщаемую производительность и средства защиты. Наш анализ показывает, что ни одно семейство объяснений не является одинаково небезопасным, и ни одна защита не является одинаково эффективной. Риск зависит от того, какой сигнал раскрывается, как он получен, какой актив является целью и что злоумышленник уже знает. Мы утверждаем, что конфиденциальность объяснений следовательно, должна оцениваться как проблема раскрытия информации от начала до конца, при этом средства защиты должны соответствовать пути получения информации и защищаемому активу. - SoK: Privacy Attacks on Machine Learning via Explainable AI
Subscribe to:
Post Comments (Atom)
No comments:
Post a Comment