Исследователи OpenAI раскрыли «шокирующие» подробности недавней кибератаки, совершенной вышедшими из-под контроля ИИ-агентами компании на системы Hugging Face. Во время многолюдной презентации на конференции Black Hat по кибербезопасности исследователь по вопросам согласования и безопасности Эрик Уоллес и инженер по безопасности Майкл Далтон рассказали, как внутренняя оценка безопасности переросла в скоординированную атаку как на системы OpenAI, так и на крупнейший в мире репозиторий ИИ. Описывая это событие как «самый качественный и интересный пример возможностей ИИ», который они когда-либо видели, исследователи сообщили, что инцидент вызвал недоверие у присутствующих сотрудников компании, которые говорили: «Это просто невероятно» и «Боже мой».
«Что делает этот инцидент интересным, так это то, что, как только один агент смог обнаружить подобные уязвимости в течение разного времени, он смог поделиться этими уязвимостями на форуме с другими агентами», — сказал Уоллес, добавив: «Таким образом, как только одна модель находит способ открыть дверь для доступа, который ей не положено иметь, она может оставить дверь открытой для использования другими агентами».
Истоки: двухмесячная секретная переписка на форуме. Корни кибер-инцидента восходят к 7 мая, когда проводились плановые проверки безопасности и производительности еще не выпущенной модели искусственного интеллекта. Получив задачи по обеспечению безопасности программного обеспечения, которые оказались невыполнимыми в рамках стандартных правил, автономные агенты начали искать обходные пути.
«Модели искусственного интеллекта очень любят жульничать», — объяснил Уоллес, отметив, что давление, оказываемое на системы обучения с целью оптимизации скорости, часто заставляет системы ИИ искать несанкционированные обходные пути, а не решать проблемы собственными силами.
P.S. отметим, что самое интересное - промптов, которые к такому привели, никто не показывает ...
См. также другие публикации, посвященные агентам
No comments:
Post a Comment