Wednesday, October 23, 2024

0.1%

Контроль такого количества данных при тренировке LLM позволяет отравить ее обучающий набор:

"Большие языковые модели предварительно обучаются на неконтролируемых текстовых наборах данных, состоящих из триллионов токенов, извлеченных из Интернета. Предыдущие работы показали, что: (1) извлеченные из Интернета предварительно обучающие наборы данных могут быть практически отравлены злоумышленниками; и (2) злоумышленники могут скомпрометировать языковые модели после отравления наборов данных тонкой настройки. Наша работа впервые оценивает, могут ли языковые модели также быть скомпрометированы во время предварительной настройки, с акцентом на постоянство предварительных обучающих атак после того, как модели будут настроены как полезные и безвредные чат-боты. Мы предварительно обучаем ряд LLM с нуля, чтобы измерить влияние потенциального отравляющего противника при четырех различных целях атаки (отказ в обслуживании, манипулирование убеждениями, джейлбрейк и быстрая кража) и в широком диапазоне размеров моделей (от 600 МБ до 7 Б). Наш главный результат заключается в том, что отравление только 0,1% набора данных до обучения модели достаточно для того, чтобы три из четырех атак измеримо сохранялись после обучения. Более того, простые атаки, такие как отказ в обслуживании, сохраняются после обучения с уровнем отравления всего 0,001%." - отсюда

См. также другие публикации, посвященные LLM

Tuesday, October 22, 2024

Состязательные атаки на LLM

"Большая часть работы по состязательным атакам проводится на изображениях. Это работа в непрерывном, многомерном пространстве. Атаки на дискретные данные, такие как текст, считаются гораздо более сложными из-за отсутствия прямых градиентных сигналов. Состязательные атаки — это входные данные, которые заставляют модель выводить что-то нежелательное. Большая часть ранней литературы была сосредоточена на задачах классификации, в то время как недавние усилия начинают больше исследовать выходные данные генеративных моделей. В контексте больших языковых моделей, в этой статье предполагается, что атаки происходят только во время вывода, что означает, что веса модели фиксированы." - хороший обзор атак на LLM

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению и LLM

Цифровые двойники и CPS

Пара интересных работ по использованию цифровых двойников в кибербезопасности кибер-физических систем

"Интеграция и автоматизация промышленных процессов принесли значительный рост эффективности и производительности, но также увеличили риски кибербезопасности, особенно в перерабатывающей промышленности. В этой статье представлена методология, использующая интеллектуальный анализ процессов и цифровых двойников для улучшения обнаружения аномалий в промышленных системах управления (ICS). Преобразуя необработанные журналы устройств в журналы событий, мы обнаруживаем закономерности и аномалии, указывающие на кибератаки, даже когда такие атаки маскируются обычными эксплуатационными данными. Мы представляем подробное исследование случая, воспроизводящего промышленный процесс, чтобы продемонстрировать практическое применение нашего подхода. Экспериментальные результаты подтверждают эффективность нашего метода в выявлении киберфизических атак в реалистичной промышленной обстановке." - отсюда. Иными словами идея следующая: автоматически преобразовать системный журнал в журнал событий, а затем искать паттерны атаки уже по событиям

Безопасность киберфизических систем (CPS) при наличии кибератак имеет решающее значение для благополучия персонала, эксплуатирующего их, и безопасности предоставляемых услуг. Например, CPS может быть развернута в промышленной автоматизации и критической инфраструктуре. Взаимозависимость между ее компонентами подразумевает, что атака на один из них может вызвать каскадный сбой в системе из-за неисправностей (отклонений от поведения соответствия) во время работы компонента(ов). Это может затруднить работу и повлиять на безопасность. Наша цель — проанализировать последствия кибератак на компоненты — чтобы лучше охватить горизонт событий безопасности (границу, до которой события не могут повлиять на безопасность) физической системы. Для этого мы интегрируем модель каскадных отказов в цифровой двойник (DT), используя поведенческие модели компонентов системы на основе вероятностного автомата Мили. Наш DT разработан для обеспечения анализа безопасности путем выявления отклонений, которые могут повлиять на функциональную и физическую безопасность. - отсюда

Monday, October 21, 2024

Атаки во благо

Если нельзя предотвратить, то нужно это возглавить. Добавление состязательных модификаций к исходным данным для защиты.

Состязательные атаки в компьютерном зрении используют уязвимости моделей машинного обучения, внося едва заметные изменения во входные данные, что часто приводит к неверным прогнозам или классификациям. Эти атаки стали более сложными с появлением глубокого обучения, представляя значительные проблемы в критически важных приложениях, которые могут быть вредны для общества. Однако существует также богатое направление исследований с преобразующей точки зрения, которое использует состязательные методы для общественного блага. В частности, мы изучаем рост проактивных схем — методов, которые шифруют входные данные с использованием дополнительных сигналов, называемых шаблонами, для повышения производительности моделей глубокого обучения. Встраивая эти незаметные шаблоны в цифровые носители, проактивные схемы применяются в различных приложениях, от простых улучшений изображений до сложных фреймворков глубокого обучения для повышения производительности по сравнению с пассивными схемами, которые не изменяют распределение входных данных для своего фреймворка. В обзоре рассматриваются методологии, лежащие в основе этих проактивных схем, процессы шифрования и обучения, и их применение в современных приложениях компьютерного зрения и обработки естественного языка. Кроме того, в нем обсуждаются проблемы, потенциальные уязвимости и будущие направления для проактивных схем, в конечном итоге подчеркивая их потенциал для содействия ответственному и безопасному развитию технологий глубокого обучения.

Sunday, October 20, 2024

Что делать с дипфейками?

Дипфейки — гиперреалистичные цифровые подделки — привлекли значительное внимание, поскольку быстрое развитие генеративного ИИ упростило создание убедительно реалистичных видео и аудиозаписей, которые могут обмануть даже самых взыскательных зрителей. Хотя дипфейки являются мощным инструментом социальной инженерии, специалистам по кибербезопасности не нужно обращаться к новым технологиям обнаружения или интенсивным программам обучения «как распознать дипфейк», чтобы снизить риск, который они представляют. Цель этого исследования — предоставить руководство, устойчивое к развивающимся угрозам, усиленным дипфейком, путем применения фундаментальных принципов безопасности.

Ключевые стратегии, которые поддерживает руководство, включают:
– Сосредоточение внимания на соблюдении процесса, а не на визуальном или слуховом обнаружении подделок
– Внедрение и поддержание строгого финансового контроля и процедур проверки
– Развитие культуры осведомленности и скептицизма в отношении необычных запросов.
– Разработка и регулярное обновление планов реагирования на инциденты.

Отсюда: OWASP - Руководство по подготовке и реагированию на события Deepfake

Определить дипфейки уже не удастся. Нужно подготовиться к жизни с ними.

См. также другие публикации по теме deepfake

Saturday, October 19, 2024

О борьбе с дипфейками

MIT Technology Review о борьбе с порно-фейками: Three ways we can fight deepfake porn

Эти три способа:
водяные знаки (метки для контента)
модификация изображений для затруднения использования их в генеративном ИИ
законодательство

о детектировании дипфейков речи уже не идет ...

Краткий курс

Краткий университетский курс по ML - книга в открытом доступе

Friday, October 18, 2024

Сдвиг концепций

"С расцветом методов машинного обучения (ML) специалисты по программному обеспечению создают системы ML для обработки огромного объема потоковых данных для различных задач по программной инженерии, таких как прогнозирование сбоев в AIOps. Обученные с использованием исторических данных, такие модели ML сталкиваются с ухудшением производительности, вызванным дрейфом концепций, т. е. изменениями данных и взаимосвязей (концепций) между обучением и производством. Важно использовать обнаружение разрыва концепций для мониторинга развернутых моделей ML и повторного обучения моделей ML при необходимости.

В этой работе мы исследуем применение современных (SOTA) методов обнаружения дрейфа концепций на синтетических и реальных наборах данных в промышленных условиях. Такие промышленные условия требуют минимальных ручных усилий по маркировке и максимальной общности в архитектуре модели ML. Мы обнаружили, что текущие полуконтролируемые методы SOTA не только требуют значительных усилий по маркировке, но и работают только для определенных типов моделей ML. Чтобы преодолеть такие ограничения, мы предлагаем новую модельно-независимую технику (CDSeer) для обнаружения дрейфа концепций. Наша оценка показывает, что CDSeer имеет лучшую точность и полноту по сравнению с современными решениями, при этом требуя значительно меньше ручной маркировки. Мы демонстрируем эффективность CDSeer при обнаружении дрейфа концепций, оценивая его на восьми наборах данных из разных доменов и вариантов использования. Результаты внутреннего развертывания CDSeer на промышленном запатентованном наборе данных показывают улучшение точности на 57,1% при использовании на 99% меньше меток по сравнению с методом обнаружения дрейфа концепций SOTA. Производительность также сопоставима с контролируемым методом обнаружения дрейфа концепций, который требует маркировки 100% данных. Повышенная производительность и простота внедрения CDSeer ценны для повышения надежности систем машинного обучения." - отсюда

Отражение атак на IDS

IDS-Anta: An open-source code with a defense mechanism to detect adversarial attacks for intrusion detection system

"Система обнаружения вторжений (IDS) имеет решающее значение для защиты организаций от киберугроз. Уязвимость IDS на основе машинного обучения и глубокого обучения к состязательным атакам возникает из-за преднамеренного создания злоумышленниками состязательных образцов. В этом исследовании предлагается репозиторий открытого исходного кода на основе Python под названием IDS-Anta с надежным механизмом защиты для выявления состязательных атак без ущерба для производительности IDS. Он использует многорукие бандиты с выборкой Томсона, оптимизацию колонии муравьев (ACO) и методы генерации состязательных атак и проверен с использованием трех общедоступных наборов данных эталонных тестов. Этот репозиторий кода можно легко применять и реплицировать в наборах данных IDS против состязательных атак."

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Thursday, October 17, 2024

О достоверных данных

Наука о достоверных данных предлагает структуру для оценки достоверности ваших результатов, демонстрируя, что они соответствуют (или предсказуемы) реальному сценарию, в котором они будут применяться, и активно изучая ряд источников неопределенности с помощью серии исследований стабильности, все в контексте реального мира проблемы предметной области.

Эта структура называется структурой предсказуемости, вычислимости и стабильности (PCS). Вы можете показать, что ваши результаты предсказуемы, вычислительно продемонстрировав, что они повторно появляются в соответствующих будущих данных и соответствуют знаниям предметной области (предсказуемость можно рассматривать как проверку реальности), и вы можете показать, что они стабильны, вычислительно продемонстрировав, что они не меняются кардинально, когда соответствующие изменения вносятся в течение всего жизненного цикла. Вычислительно демонстрируя, что ваши результаты предсказуемы и стабильны, вы предоставляете доказательства того, что ваши выводы, основанные на данных (и последующие решения в реальном мире), заслуживают доверия и соответствуют реальности. - книга в открытом доступе

Сенсоры - в блокчейн

Безопасные данные дистанционного зондирования с помощью блокчейна Технология распределенного реестра: решение для умных городов

"В частности, в контексте умных городов данные дистанционного зондирования (ДЗ) стали одной из самых горячих тем для изучения в области информационно-коммуникационных технологий (ИКТ) сегодня. Развитие машинного обучения (МО) и искусственного интеллекта (ИИ) позволило решить ряд проблем, включая автоматизацию, контроль доступа, оптимизацию, мониторинг и управление. Одновременно с этим существуют значительные проблемы с проектированием и разработкой иерархии процессов, включая неадекватные записи обучения, централизованную архитектуру, защиту конфиденциальности данных и общие ограничения потребления ресурсов. С другой стороны, развитие технологии распределенного реестра (DLT) обеспечивает децентрализованную инфраструктуру, которая позволяет системам устранять централизованные процедуры обмена данными умных городов при переходе от одного сетевого узла к другому, а контроль доступа третьей стороны решает проблемы машинного обучения. Для обработки идеального механизма доставки данных для аналитической модели умных городов в статье используется Частичная оптимизация Swam (POS) в сочетании с защищенной распределенной сетью консорциума блокчейна. Эта работа вносит три вклада. Во-первых, она предлагает безопасный метод передачи, который объединяет блокчейн и машинное обучение для оптимизации пути надежной доставки данных по защищенным каналам. Во-вторых, последовательности шифрования соседства выполняются с использованием шифрования значений с поддержкой повторного шифрования NuCypher proxy, криптографического подхода с открытым ключом, который избегает преобразования шифра. В-третьих, искусственные нейронные сети (ИНС) могут решить проблему классификации доставки данных в умных городах за счет оптимизации управления и сохранения записей."

Wednesday, October 16, 2024

Атаки глубокого леса

Уязвимость Deep Forest к состязательным атакам

"Классификаторы машинного обучения уязвимы к состязательным примерам, которые представляют собой тщательно созданные входные данные, предназначенные для скомпрометировать их эффективность классификации. Недавно был предложен новый классификатор машинного обучения, состоящий из лесов деревьев решений, вдохновленных архитектурой глубоких нейронных сетей. Однако глубокие нейронные сети уязвимы к состязательным атакам. Поэтому в этой работе мы запускаем серию состязательных атак на глубокие леса, включая атаки черного ящика и белого ящика, чтобы впервые оценить его уязвимость к состязательным атакам. Предыдущие работы показали, что состязательные примеры, созданным на одной модели, переносятся на различные модели с различными методами обучения. Мы эмпирически демонстрируем, что глубокий лес уязвим к атакам переносимости на основе кросс-техник. С другой стороны, для улучшения производительности глубокого леса в условиях состязательных ситуаций наша работа включает эксперименты, которые демонстрируют, что обучение недифференцируемых моделей, таких как глубокие леса на случайно или состязательно возмущенных входных данных, увеличивает их состязательную устойчивость к таким атакам. Кроме того, предложен эвристический метод белого ящика для атаки на глубокие леса путем реализации более быстрого и эффективного алгоритма атаки дерева решений. Атакуя оба компонента глубокого леса, а именно каскадный лес и многозернистый слой, мы показываем, что глубокие леса восприимчивы к предлагаемой состязательной атаке белого ящика."

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Tuesday, October 15, 2024

Генерация синтетических данных

Генеративные модели в транспортных исследованиях

Глубокие генеративные модели (DGM) быстро развивались в последние годы, став важными инструментами в различных областях благодаря своей способности изучать сложные распределения данных и генерировать синтетические данные. Их важность в транспортных исследованиях все больше признается, особенно для таких приложений, как генерация данных о дорожном движении, прогнозирование и извлечение признаков. Эта статья предлагает всеобъемлющее введение и руководство по DGM с акцентом на их применение в транспорте. Она начинается с обзора генеративных моделей, за которым следуют подробные объяснения фундаментальных моделей, систематический обзор литературы и практический обучающий код для помощи в реализации. В статье также обсуждаются текущие проблемы и возможности, подчеркивая, как эти модели могут быть эффективно использованы и далее развиты в транспортных исследованиях. Эта статья служит ценным справочником, направляющим исследователей и практиков от фундаментальных знаний к передовым приложениям DGM в транспортных исследованиях.

Большое О

Big O notation

O(1)
Это нотация постоянного времени. Время выполнения остается постоянным независимо от размера входных данных. Например, доступ к элементу в массиве по индексу и вставка/удаление элемента в хэш-таблице.

O(n) Линейная нотация времени. Время выполнения растет прямо пропорционально размеру входных данных. Например, поиск максимального или минимального элемента в несортированном массиве.

O(log n)
Логарифмическая нотация времени. Время выполнения медленно увеличивается по мере увеличения входных данных. Например, бинарный поиск в отсортированном массиве и операции над сбалансированными бинарными деревьями поиска.

O(n^2)
Квадратичная нотация времени. Время выполнения растет экспоненциально с размером входных данных. Например, простые алгоритмы сортировки, такие как пузырьковая сортировка, сортировка вставкой и сортировка выбором.

O(n^3)
Кубическая нотация времени. Время выполнения быстро увеличивается по мере увеличения размера входных данных. Например, умножение двух плотных матриц с использованием наивного алгоритма.

O(n logn)
Линейная нотация времени. Это смесь линейного и логарифмического роста. Например, эффективные алгоритмы сортировки, такие как сортировка слиянием, быстрая сортировка и сортировка кучей

O(2^n)
Экспоненциальная нотация времени. Время выполнения удваивается с каждым новым элементом ввода. Например, рекурсивные алгоритмы решают задачи, разделяя их на несколько подзадач.

O(n!)
Факториальная нотация времени. Время выполнения резко возрастает с размером ввода. Например, задачи генерации перестановок.

O(sqrt(n))
Квадратная нотация времени. Время выполнения увеличивается относительно квадратного корня ввода. Например, поиск в диапазоне, таком как решето Эратосфена, для нахождения всех простых чисел до n.

Sunday, October 13, 2024

Вредоносные LLM

Интересная работа Ziong Lin - реальное тестирование вредоносных LLM: Malla: Demystifying Real-world Large Language Model Integrated Malicious Services

Что нового: Зилонг Лин и его коллеги из Университета Индианы в Блумингтоне изучали, как большие языковые модели (LLM) используются для предоставления вредоносных услуг, в частности, для генерации вредоносного кода, фишинговых писем и фишинговых веб-сайтов. Они были не очень эффективны, в общем и целом (хотя высокий уровень успеха может быть необязательным для поддержки процветающего рынка автоматизированной преступной деятельности).

Рискованный бизнес: поставщики основывают такие услуги либо на неотцензурированных LLM — то есть тех, которые не были настроены на отражение человеческих предпочтений или не используют фильтры ввода/вывода — либо на общедоступных моделях, которые они предлагают с помощью методов джейлбрейка, которые обходят встроенные защитные ограждения. Они продают свои услуги на хакерских рынках и форумах, взимая гораздо меньше, чем типичные традиционные поставщики вредоносного ПО, но услуги, основанные на моделях, которые были настроены на предоставление вредоносного вывода, требуют наценки. Авторы обнаружили, что одна услуга принесла доход более 28 000 долларов за два месяца.

Разрастающийся рынок: авторы выявили 212 вредоносных сервисов. Из них 125 размещались на платформе Poe AI, 73 — на FlowGPT, а остальные 14 находились на уникальных серверах. Из них авторы не смогли получить доступ к пяти, поскольку либо провайдер их заблокировал, либо сервис был мошенническим. Они выявили 11 LLM, используемых этими сервисами, включая Claude-2-100k, GPT-4 и Pygmalion-13B (вариант LLaMA-13B).

Тестирование качества вывода: авторы запросили более 200 сервисов, используя более 30 запросов, для генерации вредоносного кода, фишинговых писем или фишинговых веб-сайтов. Они оценивали ответы по следующим параметрам:


Формат: как часто они следовали ожидаемому формату (как определено регулярными выражениями)
Компиляция: как часто сгенерированный код Python, C или C++ мог быть скомпилирован
Достоверность: как часто сгенерированный HTML и CSS успешно запускались как в Chrome, так и в Firefox
Читаемость: как часто сгенерированные фишинговые письма были плавными и связными в соответствии с индексом сложности чтения Ганнинга
Уклончивость или как часто сгенерированный текст успешно проходил все предыдущие проверки и избегал обнаружения VirusTotal (для вредоносного кода и фишинговых сайтов) или OOPSpam (для фишинговых писем).

Во всех трех задачах по крайней мере одна служба достигла уклончивости 67 процентов или выше, в то время как большинство служб достигли уклончивости менее 30 процентов.

Тестирование эффективности в реальных условиях: Кроме того, авторы провели практические тесты, чтобы увидеть, насколько хорошо выходные данные работают в реальных ситуациях. Они побудили девять служб сгенерировать код, который будет нацелен на три конкретные уязвимости, связанные с переполнением буфера и инъекцией SQL. В этих тестах модели были заметно менее успешными.

Авторы протестировали сгенерированный код на наличие двух уязвимостей в VICIdial, системе колл-центра, которая, как известно, уязвима к таким проблемам. Из 22 сгенерированных программ, которые удалось скомпилировать, ни одна не изменила базы данных VICIdial или не раскрыла системные данные. Они также протестировали сгенерированный код на OWASP WebGoat 7.1, веб-сайте, который предоставляет код с известными уязвимостями безопасности. Из 39 сгенерированных программ, которые удалось скомпилировать, семь запустили успешные атаки. Однако эти атаки не были нацелены на конкретные уязвимости, запрошенные авторами.

Почему это важно: Предыдущая работа показала, что сервисы на основе LLM могут генерировать дезинформацию и другой вредоносный вывод, но мало исследований изучали их фактическое использование в киберпреступности. Эта работа оценивает их качество и эффективность. Кроме того, авторы опубликовали подсказки, которые они использовали для обхода ограждений и генерации вредоносного вывода — ресурс для дальнейших исследований, направленных на исправление таких проблем в будущих моделях.

Мы думаем: отрадно видеть, что вредоносные сервисы не продвинулись далеко в реальных тестах, и выводы авторов должны смягчить паникерские сценарии киберпреступности с использованием ИИ. Это не значит, что нам не нужно беспокоиться о вредоносных применениях технологии ИИ. Сообщество ИИ несет ответственность за разработку своих продуктов так, чтобы они были полезными, и тщательно оценивать их на предмет безопасности.

/via deeplearning.ai

См. также другие публикации, посвященные LLM

Friday, October 11, 2024

О проблемах автономного вождения

Интересная работа с анализом аварий в автовождении - ROCAS: Анализ первопричин аварий с автономным вождением через киберфизическую комутацию

"Поскольку автономные системы вождения (ADS) изменили нашу повседневную жизнь, безопасность ADS приобретает все большее значение. Хотя появились различные подходы к тестированию для повышения надежности ADS, остается существенный пробел в понимании причин аварий. Такой анализ после аварий имеет первостепенное значение и полезен для повышения безопасности и надежности ADS. Существующие методы анализа первопричин киберфизических систем (CPS) в основном предназначены для дронов и не могут справиться с уникальными проблемами, возникающими из-за более сложных физических сред и моделей глубокого обучения, развернутых в ADS. В этой статье мы устраняем этот пробел, предлагая формальное определение проблемы анализа первопричин ADS и представляя Rocas, новую структуру анализа первопричин ADS с киберфизической коммутацией. Наша методика уникальным образом использует как физическую, так и кибермутацию, которая может точно идентифицировать сущность, вызывающую аварию, и точно определить неверную конфигурацию целевой ADS, ответственной за аварию. Мы также разрабатываем дифференциальный анализ для определения ответственного модуля, чтобы сократить пространство поиска неверной конфигурации. Мы изучаем 12 категорий аварий ADS и демонстрируем эффективность и результативность Rocas в сужении пространства поиска и выявлении неправильной конфигурации. Мы также показываем подробные примеры того, как выявленная неправильная конфигурация помогает понять обоснование аварий."

Примеры причин аварий:
Принимает красный грузовик за красный свет и внезапно останавливается на кольцевом перекрестке
Опознает неправильный светофор из-за особой формы дороги и внезапно останавливается на дороге

См. в этой связи нашу статью О состязательных атаках на автономные транспортные средства