Showing posts sorted by date for query очистке. Sort by relevance Show all posts
Showing posts sorted by date for query очистке. Sort by relevance Show all posts

Thursday, November 27, 2025

Как же он служил в очистке?

Длинноконтекстные LLM уязвимы к внедрению подсказок, когда злоумышленник может внедрить инструкцию в длинный контекст, чтобы побудить LLM сгенерировать желаемый злоумышленником вывод. Существующие методы защиты от внедрения подсказок разработаны для коротких контекстов. При распространении на сценарии с длинным контекстом они имеют ограниченную эффективность. Причина в том, что внедренная инструкция составляет лишь очень малую часть длинного контекста, что делает защиту очень сложной. В данной работе мы предлагаем PISanitizer, который сначала выявляет и дезинфицирует потенциально внедренные токены (если таковые имеются) в контексте, прежде чем позволить бэкенд-LLM сгенерировать ответ, тем самым устраняя влияние внедренной инструкции. Для дезинфекции внедренных токенов PISanitizer основывается на двух наблюдениях: (1) атаки с внедрением подсказок, по сути, создают инструкцию, которая заставляет LLM следовать ей, и (2) LLM по сути используют механизм внимания, чтобы сосредоточиться на критически важных входных токенах для генерации вывода. Руководствуясь этими двумя наблюдениями, мы сначала намеренно позволяем LLM следовать произвольным инструкциям (если таковые имеются) в контексте, а затем дезинфицируем токены, получающие повышенное внимание и управляющие поведением LLM, связанным с следованием инструкциям. По своей сути PISanitizer представляет собой дилемму для злоумышленника: чем эффективнее внедренная инструкция заставляет LLM следовать ей, тем выше вероятность, что она будет дезинфицирована PISanitizer. Наш обширный анализ показывает, что PISanitizer может успешно предотвращать внедрение подсказок, сохранять полезность, превосходить существующие средства защиты, является эффективным и устойчивым к атакам, основанным на оптимизации, и сильным адаптивным атакам. Код доступен по адресу https://github.com/sleeepeer/PISanitizer - PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization

Интиересная идея - очищать промпты с помощью другой LLM

Thursday, January 23, 2025

Новый подход к очистке данных

Технология глубокого обучения (DL) показала выдающуюся производительность в различных областях, таких как распознавание и классификация объектов, распознавание речи и обработка естественного языка. Однако хорошо известно, что модели DL уязвимы для атак с отравлением данных, когда злоумышленники изменяют или злонамеренно вводят образцы данных на этапе обучения, что приводит к снижению точности классификации или неправильной классификации. Поскольку атаки с отравлением данных продолжают развиваться, чтобы избежать существующих методов защиты, исследователи безопасности тщательно изучают модели атак с отравлением данных и соответственно разрабатывают более надежные и эффективные методы обнаружения. В частности, атаки с отравлением данных могут быть реалистичными в состязательной ситуации, когда мы переобучаем модель DL с новым набором данных, полученным из внешнего источника во время трансферного обучения. Исходя из этой мотивации, мы предлагаем новый метод защиты, который разделяет и проверяет новый набор данных, а затем удаляет вредоносные поднаборы данных. В частности, наш предлагаемый метод сначала делит новый набор данных на n поднаборов данных либо равномерно, либо случайным образом, проверяет их, используя чистую модель DL в качестве детектора отравленных наборов данных, и, наконец, удаляет вредоносные поднаборы данных, классифицированные детектором. Для разделения и проверки мы разрабатываем два динамических защитных алгоритма: алгоритм последовательного разделения и проверки (SPIA) и алгоритм рандомизированного разделения и проверки (RPIA). При таком подходе полученный очищенный набор данных можно надежно использовать для повторного обучения модели DL. Кроме того, мы провели два эксперимента в среде Python и DL, чтобы показать, что наши предлагаемые методы эффективно защищают от двух моделей атак отравления данных (концентрированные атаки отравления и случайные атаки отравления) с точки зрения различных метрик оценки, таких как скорость удаленного отравления (RPR), скорость успешной атаки (ASR) и точность классификации (ACC). В частности, SPIA полностью удалил все отравленные данные при концентрированных атаках отравления как в среде Python, так и в среде DL. Кроме того, RPIA удалил до 91,1% и 99,1% зараженных данных при случайных атаках отравления в средах Python и DL соответственно. - A Novel Data Sanitization Method Based on Dynamic Dataset Partition and Inspection Against Data Poisoning Attacks

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Wednesday, March 06, 2024

Чистильщик бэкдоров

Интересная идея по очистке бэкдоров в онлайне. Готовят теневую модель, дообучая базовую модель на гарантированно чистых примерах. Далее параллельно подают ходные данные базовой модели и теневой модели. Из сравнения результатов работы делают заключение о наличии бэкдора.

См. также другие публикации по бэкдор атакам

Saturday, February 25, 2023

Но как же он работает в очистке?

Хороший практический материал по очистке табличных данных в трех частях: часть 1, часть 2 (workflow), часть 3 (примеры)

См. также другие публикации, посвященные очистке данных