Saturday, September 26, 2026

Просто, но эффективно

Инъекция промптов (prompt injection) признана серьезной угрозой безопасности для ИИ-агентов, взаимодействующих с ненадежными внешними данными, такими как веб-сайты, документы и электронные письма. Предыдущие исследования показали, что в текстовой сфере атаки методом «черного ящика» (black-box) позволяют достичь практически стопроцентной эффективности (ASR). Однако в области обработки изображений существующие методы визуальной инъекции промптов значительно менее эффективны при попытках спровоцировать передовые коммерческие мультимодальные языковые модели (VLM) на действия, способные нанести существенный вред. Добиться такого результата сложно, поскольку для этого требуется длинная целевая строка или строка, строго соответствующая определенному формату — например, точный, синтаксически корректный вызов встроенного инструмента с указанием конкретных имен функций и аргументов. Мы представляем Repeat-After-Me — адаптивную атаку методом «черного ящика», использующую визуальную инъекцию промптов для раскрытия персональных данных или выполнения вредоносных вызовов инструментов. При тестировании как на моделях с открытыми весами, так и на передовых коммерческих VLM (включая Qwen3.6-27B и GPT-5.5), наш метод демонстрирует показатели успешности (ASR) выше 82% и 47% соответственно. Испытания проводились в реалистичных условиях, когда исходный запрос пользователя не имел семантической связи с внедряемой задачей и не содержал явного разрешения на ее выполнение. Наш оптимизированный метод инъекции отличается высокой переносимостью атаки между различными коммерческими VLM и наборами нейтральных входных данных. Мы демонстрируем, что наша атака эффективна даже в тех случаях, когда адаптивная текстовая инъекция промптов не срабатывает. В реальном сценарии использования агента OpenClaw, интегрированного с Discord, злоумышленник может использовать специально подготовленное изображение для перезаписи файла TOOLS.md, что открывает возможности для выполнения опасных действий, таких как удаленное выполнение кода и кража конфиденциальной информации. Также мы рассматриваем возможные способы защиты от подобных атак. - Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection

См. также другие публикации, посвященные MLLM

No comments: