См. также другие публикации, посвященные VLM
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Thursday, August 06, 2026
О безопасности LVLM
Благодаря интеграции дополнительной модальности, большие визуально-языковые модели (LVLM) демонстрируют большую уязвимость к рискам безопасности (например, взлому системы) по сравнению со своими предшественниками, основанными только на языке. Хотя в недавних исследованиях были приложены значительные усилия к постфактумному выравниванию LVLM, внутренние механизмы безопасности
остаются в значительной степени неизученными. В этой статье мы обнаружили, что активация точек внимания LVLM может создавать значительную линейную разделимость вредоносных и безобидных подсказок. Мы предполагаем, что присущее модели восприятие безопасности регулируется редкими точками внимания, которые мы называем «точками безопасности». Дальнейший
анализ показывает, что эти точки действуют как специализированные щиты против вредоносных подсказок; их удаление приводит к более высоким показателям успешности атак,
при этом полезность модели остается неизменной, что дополнительно подтверждает нашу гипотезу. Помимо эмпирических данных, мы также проводим семантический анализ, показывающий, что защитные элементы способны изолировать и усиливать небезопасную семантику как в изображениях, так и в текстовых входных данных, предлагая интерпретируемые сведения об их защитной
роли. Обнаруживая эти защитные элементы и объединяя их активации, мы создаем простой, но мощный детектор вредоносных подсказок, который легко интегрируется в процесс генерации
с минимальными дополнительными затратами на вывод. Несмотря на свою простую структуру модели логистической регрессии, детектор, как ни удивительно, демонстрирует сильные возможности обобщения без предварительного обучения. Эксперименты в различных атаках на основе подсказок как в области изображений, так и в области видео подтверждают эффективность использования защитных элементов для защиты LVLM. - SAHs: Unraveling Safety Attention Heads in Large Vision-Language Models
Subscribe to:
Post Comments (Atom)
No comments:
Post a Comment