См. также другие публикации, посвященные VLM
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Thursday, August 06, 2026
О безопасности LVLM
Tuesday, June 30, 2026
Бэкдоры сегодня
Атаки с использованием бэкдоров против нейронных сетей позволяют злоумышленникам внедрять скрытые модели поведения, которые активируются во время вывода, сохраняя при этом высокую производительность на чистых входных данных. Атаки с использованием бэкдоров с чистыми метками особенно скрытны, поскольку они отравляют обучающие данные, не изменяя истинные метки, что затрудняет обнаружение вредоносных образцов с помощью традиционной проверки данных. Эта угроза особенно актуальна, когда обучающие данные собираются из ненадежных, внешних или распределенных источников. В данной статье представлен систематический обзор атак с использованием бэкдоров с чистыми метками и отравлением данных в классификации изображений. Мы вводим единую двухуровневую таксономию, которая сначала различает атаки, содержащие триггеры, и атаки без триггеров, а затем организует каждую категорию в соответствии с лежащими в ее основе механизмами атаки. На основе этой таксономии мы анализируем 18 репрезентативных методов и сравниваем их с точки зрения эффективности атаки, скрытности и операционных предположений, используя общепринятые метрики, такие как частота успешных атак и точность на чистых данных. Мы также изучаем настройки знаний злоумышленников и практические сценарии развертывания, чтобы оценить реальную осуществимость этих атак. Кроме того, мы выявляем новые тенденции, включая адаптивные и специфичные для выборки триггеры, обсуждаем ограничения существующих стратегий защиты и описываем открытые проблемы в оценке и смягчении последствий. Наконец, мы предлагаем стандартизированную систему отчетности для повышения воспроизводимости, сопоставимости и согласованности между исследованиями. Этот обзор обеспечивает структурированное понимание атак с использованием бэкдоров с «чистой меткой» и предлагает рекомендации по разработке более надежных и безопасных систем машинного обучения. - Clean-Label Backdoor Attacks: A Survey
Атаки с использованием бэкдоров позволяют злоумышленникам внедрять вредоносное поведение в модели машинного обучения путем отравления обучающих данных триггерами. Исследователи в основном сосредоточивались на бэкдорах в одномодальных моделях. Однако появление многомодальных систем, например, моделей «зрение-язык» (VLM) и многомодальных больших языковых моделей (MLLM), значительно расширило поверхность атаки. Многомодальные бэкдоры могут использовать кросс-модальные триггеры, манипулирование на уровне представления, поведение, обусловленное инструкциями, и пути активации во время тестирования, которые недоступны в одномодальных моделях. Тем не менее, количественная оценка прогресса в этой области остается сложной задачей из-за фрагментированных наборов данных, непоследовательных моделей угроз, и отсутствия стандартизированных протоколов оценки. Эта методологическая непоследовательность ограничивает сравнительный анализ и препятствует систематическому пониманию устойчивости в многомодальных условиях. В данной статье представлено мета-исследование многомодальных атак с использованием бэкдоров и проанализировано, как методологическая фрагментация подрывает воспроизводимость и кумулятивное научное понимание. Мы утверждаем, что для надежного и систематического развития исследований многомодальных атак с использованием бэкдоров необходимы стандартизированные контрольные показатели и обратно совместимые протоколы оценки. - Meta-Research on Backdoors: Dataset and Threat Model Shifts in Multimodal Backdoor Attacks
См. также другие публикации по бэкдор атакам
Saturday, May 23, 2026
Атаки на VLM
См. также другие публикации, посвященные LLM
Monday, November 10, 2025
Инъекции подсказок для VLM
Saturday, November 08, 2025
Универсальный камуфляж для VLM
1) Физические состязательные атаки, в первую очередь, нацелены на модули зрения. Их трудно напрямую перенести на системы VLM-AD, поскольку они обычно атакуют низкоуровневые компоненты восприятия.
2) Состязательные атаки на VLM-AD в основном сосредоточены на цифровом уровне. Они страдают от значительных ограничений при развертывании в реальном мире, включая отсутствие физической реализуемости и чувствительность к изменчивости окружающей среды.
Для решения этих проблем мы предлагаем первую платформу универсальной камуфляжной атаки (UCA) для VLM-AD. В отличие от предыдущих методов, ориентированных на оптимизацию логит-слоя, UCA работает в пространстве признаков для генерации физически реализуемых камуфляжных текстур, демонстрирующих сильную генерализацию для различных пользовательских команд и архитектур моделей. В связи с наблюдаемой уязвимостью слоёв кодировщика и проекции в VLM-AD, UCA вводит потерю дивергенции признаков (FDL), которая максимизирует расхождение репрезентативности между чистыми и состязательными изображениями. Кроме того, UCA использует многомасштабную стратегию обучения и корректирует коэффициент дискретизации для повышения своей адаптивности к изменениям масштаба и разнообразию точек обзора в реальных сценариях, тем самым повышая стабильность обучения. Многочисленные эксперименты показывают, что UCA может вызывать неверные команды управления в различных моделях VLM-AD и сценариях управления, значительно превосходя существующие современные методы атак (улучшение на 30% по метрикам 3-P). Кроме того, UCA демонстрирует высокую устойчивость к атакам при различных точках обзора и в динамических условиях, что указывает на высокий потенциал для практического применения. - Universal Camouflage Attack on Vision-Language Models for Autonomous Driving
P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению
Monday, September 22, 2025
Бэкдоры для роботов
Saturday, August 09, 2025
Универсальные атаки
2. Мы представляем кросс-доменную многоцелевую атаку (CDMTA) – метод генерации состязательных примеров, которые вводят классификаторы изображений в заблуждение относительно любого целевого класса, включая те, которые не были обнаружены во время обучения. Традиционные целевые атаки ограничены одним классом на модель, что требует дорогостоящего переобучения для каждой цели. Многоцелевые атаки решают эту проблему путем введения генератора возмущений с условным входом для указания целевого класса. Однако существующие методы ограничены классами, наблюдаемыми во время обучения, и требуют доступа к обучающим данным модели «черного ящика», что приводит к утечке данных, которая подрывает реалистичность оценки в практических сценариях «черного ящика». Мы определяем чрезмерную зависимость от векторных представлений классов как ключевое ограничение, приводящее к переобучению и плохому обобщению на невидимые классы. Для решения этой проблемы CD-MTA заменяет контроль на уровне классов условным входом на основе изображений и вводит независимые от класса потери, которые выравнивают возмущенные и целевые изображения в пространстве признаков. Такая конструкция устраняет зависимость от семантики классов, тем самым позволяя обобщение на невиданные классы в разных наборах данных. Эксперименты на ImageNet и семи других наборах данных показывают, что CD-MTA превосходит предыдущие многоцелевые атаки как в стандартных, так и в кросс-доменных условиях — без доступа к обучающим данным модели «черного ящика». - Breaking Dataset Boundaries: Class-Agnostic Targeted Adversarial Attacks
P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению