Showing posts sorted by date for query vlm. Sort by relevance Show all posts
Showing posts sorted by date for query vlm. Sort by relevance Show all posts

Thursday, August 06, 2026

О безопасности LVLM

Благодаря интеграции дополнительной модальности, большие визуально-языковые модели (LVLM) демонстрируют большую уязвимость к рискам безопасности (например, взлому системы) по сравнению со своими предшественниками, основанными только на языке. Хотя в недавних исследованиях были приложены значительные усилия к постфактумному выравниванию LVLM, внутренние механизмы безопасности остаются в значительной степени неизученными. В этой статье мы обнаружили, что активация точек внимания LVLM может создавать значительную линейную разделимость вредоносных и безобидных подсказок. Мы предполагаем, что присущее модели восприятие безопасности регулируется редкими точками внимания, которые мы называем «точками безопасности». Дальнейший анализ показывает, что эти точки действуют как специализированные щиты против вредоносных подсказок; их удаление приводит к более высоким показателям успешности атак, при этом полезность модели остается неизменной, что дополнительно подтверждает нашу гипотезу. Помимо эмпирических данных, мы также проводим семантический анализ, показывающий, что защитные элементы способны изолировать и усиливать небезопасную семантику как в изображениях, так и в текстовых входных данных, предлагая интерпретируемые сведения об их защитной роли. Обнаруживая эти защитные элементы и объединяя их активации, мы создаем простой, но мощный детектор вредоносных подсказок, который легко интегрируется в процесс генерации с минимальными дополнительными затратами на вывод. Несмотря на свою простую структуру модели логистической регрессии, детектор, как ни удивительно, демонстрирует сильные возможности обобщения без предварительного обучения. Эксперименты в различных атаках на основе подсказок как в области изображений, так и в области видео подтверждают эффективность использования защитных элементов для защиты LVLM. - SAHs: Unraveling Safety Attention Heads in Large Vision-Language Models

См. также другие публикации, посвященные VLM

Tuesday, June 30, 2026

Бэкдоры сегодня

Пара интересных работ по бэкдор-атакам.

Атаки с использованием бэкдоров против нейронных сетей позволяют злоумышленникам внедрять скрытые модели поведения, которые активируются во время вывода, сохраняя при этом высокую производительность на чистых входных данных. Атаки с использованием бэкдоров с чистыми метками особенно скрытны, поскольку они отравляют обучающие данные, не изменяя истинные метки, что затрудняет обнаружение вредоносных образцов с помощью традиционной проверки данных. Эта угроза особенно актуальна, когда обучающие данные собираются из ненадежных, внешних или распределенных источников. В данной статье представлен систематический обзор атак с использованием бэкдоров с чистыми метками и отравлением данных в классификации изображений. Мы вводим единую двухуровневую таксономию, которая сначала различает атаки, содержащие триггеры, и атаки без триггеров, а затем организует каждую категорию в соответствии с лежащими в ее основе механизмами атаки. На основе этой таксономии мы анализируем 18 репрезентативных методов и сравниваем их с точки зрения эффективности атаки, скрытности и операционных предположений, используя общепринятые метрики, такие как частота успешных атак и точность на чистых данных. Мы также изучаем настройки знаний злоумышленников и практические сценарии развертывания, чтобы оценить реальную осуществимость этих атак. Кроме того, мы выявляем новые тенденции, включая адаптивные и специфичные для выборки триггеры, обсуждаем ограничения существующих стратегий защиты и описываем открытые проблемы в оценке и смягчении последствий. Наконец, мы предлагаем стандартизированную систему отчетности для повышения воспроизводимости, сопоставимости и согласованности между исследованиями. Этот обзор обеспечивает структурированное понимание атак с использованием бэкдоров с «чистой меткой» и предлагает рекомендации по разработке более надежных и безопасных систем машинного обучения. - Clean-Label Backdoor Attacks: A Survey

Атаки с использованием бэкдоров позволяют злоумышленникам внедрять вредоносное поведение в модели машинного обучения путем отравления обучающих данных триггерами. Исследователи в основном сосредоточивались на бэкдорах в одномодальных моделях. Однако появление многомодальных систем, например, моделей «зрение-язык» (VLM) и многомодальных больших языковых моделей (MLLM), значительно расширило поверхность атаки. Многомодальные бэкдоры могут использовать кросс-модальные триггеры, манипулирование на уровне представления, поведение, обусловленное инструкциями, и пути активации во время тестирования, которые недоступны в одномодальных моделях. Тем не менее, количественная оценка прогресса в этой области остается сложной задачей из-за фрагментированных наборов данных, непоследовательных моделей угроз, и отсутствия стандартизированных протоколов оценки. Эта методологическая непоследовательность ограничивает сравнительный анализ и препятствует систематическому пониманию устойчивости в многомодальных условиях. В данной статье представлено мета-исследование многомодальных атак с использованием бэкдоров и проанализировано, как методологическая фрагментация подрывает воспроизводимость и кумулятивное научное понимание. Мы утверждаем, что для надежного и систематического развития исследований многомодальных атак с использованием бэкдоров необходимы стандартизированные контрольные показатели и обратно совместимые протоколы оценки. - Meta-Research on Backdoors: Dataset and Threat Model Shifts in Multimodal Backdoor Attacks

См. также другие публикации по бэкдор атакам

Saturday, May 23, 2026

Атаки на VLM

Модели визуально-языкового анализа (VLM) все чаще используются в качестве авторитетных источников информации — для проверки фактов на изображениях в социальных сетях, сравнения товаров и модерации контента. Пользователи неявно доверяют этим системам, полагая, что они воспринимают тот же визуальный контент, что и они. Мы показываем, что состязательные примеры нарушают это предположение, позволяя осуществлять «отмывание авторитета ИИ»: злоумышленник незаметно искажает изображение таким образом, чтобы VLM выдавала уверенные и авторитетные ответы о «неправильном» вводе. В отличие от взлома или внедрения подсказок, наши атаки не нарушают согласованность модели; атака действует исключительно на уровне восприятия. Мы демонстрируем, что стандартные атаки на общедоступные модели CLIP надежно переносятся на используемые в производстве VLM, включая GPT-5.4, Claude Opus~4.6, Gemini~3 и Grok~4.2. На четырех типах поверхностей атаки мы показываем, что «отмывание авторитета» может усиливать дезинформацию, дискредитировать отдельных лиц, обходить модерацию контента и манипулировать рекомендациями товаров. Наши атаки демонстрируют высокую вероятность успеха: в сотнях атак, направленных на манипулирование идентификацией и обход защиты от контента непристойного характера, мы измерили показатели успешности для шести моделей. Не требуется никаких новых алгоритмов атаки: достаточно базовых методов, известных более десяти лет, что устанавливает нижний предел возможностей злоумышленника, который должен вызывать беспокойство у защитников. Наши результаты показывают, что устойчивость к визуальному противодействию теперь является практической — и до сих пор во многом нерешенной — проблемой безопасности. - Laundering AI Authority with Adversarial Examples

См. также другие публикации, посвященные LLM

Monday, November 10, 2025

Инъекции подсказок для VLM

Визуальные языковые модели обладают медицинскими знаниями и могут использоваться в здравоохранении различными способами, в том числе в качестве интерпретаторов изображений, виртуальных регистраторов и общих систем поддержки принятия решений. Однако здесь мы демонстрируем, что текущие VLM, применяемые для медицинских задач, имеют фундаментальный недостаток безопасности: они могут быть скомпрометированы атаками с инъекцией подсказок. Такие атаки могут использоваться для вывода вредоносной информации, просто взаимодействуя с VLM, без какого-либо доступа к ее параметрам. Мы проводим количественное исследование, чтобы оценить уязвимости четырех современных VLM: Claude-3 Opus, Claude-3.5 Sonnet, Reka Core и GPT-4o. Используя набор из N = 594 атак, мы показываем, что все эти модели подвержены этим атакам. В частности, мы показываем, что внедрение субвизуальных подсказок в разнообразные данные медицинской визуализации может привести к тому, что модель будет выдавать вредоносные выходные данные, и что эти подсказки неочевидны для наблюдателей-людей. Таким образом, наше исследование демонстрирует ключевую уязвимость медицинских VLM, которую следует устранить перед их широким клиническим внедрением. - Prompt injection attacks on vision language models in oncology

Saturday, November 08, 2025

Универсальный камуфляж для VLM

Моделирование визуального языка для автономного вождения (VLM-AD) становится многообещающим направлением исследований, обеспечивающим существенные улучшения в возможностях мультимодального мышления. Несмотря на свои развитые возможности мышления, VLM-AD остается уязвимой для серьезных угроз безопасности со стороны враждебных атак, которые включают в себя вводящие в заблуждение решения моделей посредством тщательно продуманных возмущений. Существующие атаки имеют очевидные проблемы:
1) Физические состязательные атаки, в первую очередь, нацелены на модули зрения. Их трудно напрямую перенести на системы VLM-AD, поскольку они обычно атакуют низкоуровневые компоненты восприятия.
2) Состязательные атаки на VLM-AD в основном сосредоточены на цифровом уровне. Они страдают от значительных ограничений при развертывании в реальном мире, включая отсутствие физической реализуемости и чувствительность к изменчивости окружающей среды.
Для решения этих проблем мы предлагаем первую платформу универсальной камуфляжной атаки (UCA) для VLM-AD. В отличие от предыдущих методов, ориентированных на оптимизацию логит-слоя, UCA работает в пространстве признаков для генерации физически реализуемых камуфляжных текстур, демонстрирующих сильную генерализацию для различных пользовательских команд и архитектур моделей. В связи с наблюдаемой уязвимостью слоёв кодировщика и проекции в VLM-AD, UCA вводит потерю дивергенции признаков (FDL), которая максимизирует расхождение репрезентативности между чистыми и состязательными изображениями. Кроме того, UCA использует многомасштабную стратегию обучения и корректирует коэффициент дискретизации для повышения своей адаптивности к изменениям масштаба и разнообразию точек обзора в реальных сценариях, тем самым повышая стабильность обучения. Многочисленные эксперименты показывают, что UCA может вызывать неверные команды управления в различных моделях VLM-AD и сценариях управления, значительно превосходя существующие современные методы атак (улучшение на 30% по метрикам 3-P). Кроме того, UCA демонстрирует высокую устойчивость к атакам при различных точках обзора и в динамических условиях, что указывает на высокий потенциал для практического применения. - Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Monday, September 22, 2025

Бэкдоры для роботов

Политики роботизированной манипуляции всё больше расширяются за счёт больших языковых моделей (LLM) и моделей визуального языка (VLM), которые используют их возможности понимания и восприятия. В последнее время безопасность задач роботизированной манипуляции широко изучается, при этом атаки с использованием бэкдоров привлекают значительное внимание из-за их скрытности и потенциального вреда. Однако существующие попытки внедрения бэкдоров ограничиваются симуляторами и сталкиваются с трудностями при попытке отравить сторонние коммерческие реализации на основе VLM в реальных роботизированных манипуляциях. Для решения этой проблемы мы предлагаем TrojanRobot, встраивающий модуль бэкдора в модульную политику роботизированной манипуляции посредством бэкдор-связей для манипулирования путем LLM-VLM и компрометации системы, при этом наша ванильная версия использует в качестве модуля тонко настроенный бэкдор VLM. Для повышения эффективности атак мы также предлагаем базовую схему, введя концепцию LVLM-как-бэкдора, которая использует контекстное обучение инструкциям (ICIL) для управления поведением большой модели зрительного восприятия. Более того, мы разрабатываем три типа базовых атак — перестановку, стагнацию и преднамеренную — достигая гибких эффектов атак бэкдора. Обширные эксперименты в физическом мире и симуляторах на 18 задачах манипуляции реальным миром и 4 VLM подтверждают превосходство предлагаемого TrojanRobot, с видеодемонстрациями, доступными на веб-сайте ссылка https://trojanrobot.github.io. - TrojanRobot: Physical-world Backdoor Attacks Against VLM-based Robotic Manipulation

Saturday, August 09, 2025

Универсальные атаки

1. Глубокие нейронные сети (DNN) добились широкого успеха, но остаются уязвимыми для состязательных атак. Как правило, такие атаки либо включают в себя частые запросы к целевой модели, либо используют суррогатные модели, точно отражающие целевую модель, — часто обучаемые на подмножествах обучающих данных целевой модели — для достижения высокой успешности атак благодаря переносимости. Однако в реалистичных сценариях, когда обучающие данные недоступны, а чрезмерные запросы могут вызвать тревогу, создание состязательных примеров становится более сложной задачей. В данной статье мы представляем UnivIntruder, новый фреймворк для атак, основанный исключительно на одной общедоступной модели CLIP и общедоступных наборах данных. Используя текстовые концепции, UnivIntruder генерирует универсальные, переносимые и целенаправленные состязательные возмущения, которые вводят DNN в заблуждение, заставляя их ошибочно классифицировать входные данные в заданные злоумышленником классы, определяемые текстовыми концепциями. Наши обширные эксперименты показывают, что наш подход обеспечивает успех атаки (ASR) до 85% на ImageNet и более 99% на CIFAR-10, значительно превосходя существующие методы, основанные на передаче данных. Кроме того, мы выявили реальные уязвимости, показав, что даже без запросов к целевым моделям UnivIntruder компрометирует поисковые системы изображений, такие как Google и Baidu, с уровнем ASR до 84%, и модели языка машинного зрения, такие как GPT-4 и Claude-3.5, с уровнем ASR до 80%. Эти результаты подчеркивают практичность нашей атаки в сценариях, где традиционные пути блокированы, что подчеркивает необходимость переоценки парадигм безопасности в приложениях ИИ. - One Surrogate to Fool Them All: Universal, Transferable, and Targeted Adversarial Attacks with CLIP. Интересный подход с использованием VLM для генерации универсальных атак.

2. Мы представляем кросс-доменную многоцелевую атаку (CDMTA) – метод генерации состязательных примеров, которые вводят классификаторы изображений в заблуждение относительно любого целевого класса, включая те, которые не были обнаружены во время обучения. Традиционные целевые атаки ограничены одним классом на модель, что требует дорогостоящего переобучения для каждой цели. Многоцелевые атаки решают эту проблему путем введения генератора возмущений с условным входом для указания целевого класса. Однако существующие методы ограничены классами, наблюдаемыми во время обучения, и требуют доступа к обучающим данным модели «черного ящика», что приводит к утечке данных, которая подрывает реалистичность оценки в практических сценариях «черного ящика». Мы определяем чрезмерную зависимость от векторных представлений классов как ключевое ограничение, приводящее к переобучению и плохому обобщению на невидимые классы. Для решения этой проблемы CD-MTA заменяет контроль на уровне классов условным входом на основе изображений и вводит независимые от класса потери, которые выравнивают возмущенные и целевые изображения в пространстве признаков. Такая конструкция устраняет зависимость от семантики классов, тем самым позволяя обобщение на невиданные классы в разных наборах данных. Эксперименты на ImageNet и семи других наборах данных показывают, что CD-MTA превосходит предыдущие многоцелевые атаки как в стандартных, так и в кросс-доменных условиях — без доступа к обучающим данным модели «черного ящика». - Breaking Dataset Boundaries: Class-Agnostic Targeted Adversarial Attacks

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению