Showing posts sorted by relevance for query NLP. Sort by date Show all posts
Showing posts sorted by relevance for query NLP. Sort by date Show all posts

Wednesday, January 01, 2020

Wednesday, July 09, 2025

SHAP для LLM

В этой статье мы предлагаем новый подход к созданию целевых состязательных примеров (атак) с использованием объяснимых методов искусственного интеллекта (XAI). Наш метод использует XAI для определения ключевых входных элементов, которые при изменении могут ввести в заблуждение модели NLP, такие как BERT и большие языковые модели (LLM), и выдавать определенные неверные результаты. Мы демонстрируем эффективность наших целевых атак в ряде задач и моделей NLP, даже в сценариях, где доступ к внутренней модели ограничен. Наш подход особенно эффективен в условиях обучения с нулевым выстрелом, подчеркивая его адаптивность и переносимость как в традиционные, так и в разговорные системы ИИ. Кроме того, мы описываем стратегии смягчения, демонстрируя, что состязательное обучение и тонкая настройка могут усилить защиту моделей от таких атак. Хотя наша работа подчеркивает уязвимости моделей LLM и BERT к состязательным манипуляциям, она также закладывает основу для разработки более надежных моделей, продвигая двойную цель понимания и обеспечения безопасности систем NLP с черным ящиком. Используя целенаправленные состязательные примеры и методы на основе SHAP, мы не только выявляем слабые стороны существующих моделей, но и предлагаем стратегии повышения устойчивости ИИ к вводящим в заблуждение языковым данным.- Precise Language Deception: XAI Driven Targeted Adversarial Examples with Restricted Knowledge

Интересная идея - построение состязательных примеров для LLM с использованием SHAP

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Saturday, February 08, 2020

ML NLP

Очень интересный обзор использования машинного обучения для NLP

См. также другие публикации, посвященные NLP

Thursday, January 09, 2020

Saturday, August 30, 2025

Красные в городе

Этические и социальные риски остаются важной, но в то же время сложной темой во взаимодействии человека и искусственного интеллекта, особенно в обеспечении безопасного использования обработки естественного языка (NLP). Появление больших языковых моделей (LLM), таких как ChatGPT, потенциально обостряет эту проблему. Однако предыдущие работы, посвященные этике и рискам, связанным с появлением LLM, либо игнорируют практические последствия в реальных сценариях, отстают от быстрого развития NLP, не имеют консенсуса пользователей по этическим рискам или не рассматривают весь спектр этических вопросов в комплексе. В данной статье мы всесторонне оцениваем, качественно исследуем и каталогизируем этические дилеммы и риски в ChatGPT посредством сравнительного анализа с восемью репрезентативными наборами данных и анализа различных тематических исследований. Наши результаты показывают, что, хотя ChatGPT демонстрирует превосходную безопасность на тестовых наборах данных, его ограничения можно обойти с помощью наших вручную подобранных примеров, что выявляет не только ограничения текущих тестов оценки рисков, но и неисследованные риски в пяти различных сценариях, включая социальную предвзятость при генерации кода, предвзятость в ответах на кросс-языковые вопросы, токсичный язык в персонализированном диалоге, вводящую в заблуждение информацию из-за галлюцинаций и подсказки для неэтичного поведения. В заключение мы приводим выводы из работы над ChatGPT и рекомендации по разработке будущих ответственных моделей больших языков. - Bypassing Guardrails: Lessons Learned from Red Teaming ChatGPT

Генеративные модели быстро набирают популярность и интегрируются в повседневные приложения, что вызывает опасения по поводу их безопасного использования, поскольку выявляются различные уязвимости. В связи с этим область «red team» переживает стремительный рост, что подчеркивает необходимость комплексного исследования, охватывающего весь процесс разработки и затрагивающего новые темы. Наш обширный обзор, в котором рассматривается более 120 статей, представляет собой классификацию детализированных стратегий атак, основанных на внутренних возможностях языковых моделей. Кроме того, мы разработали фреймворк «поисковика» для унификации различных подходов к автоматическому тестированию (read team). Более того, наш обзор охватывает новые области, включая мультимодальные атаки и защиту, риски, связанные с агентами на основе LLM, избыточное использование безвредных запросов и баланс между безвредностью и полезностью. - Against The Achilles' Heel: A Survey on Red Teaming for Generative Models

См. также другие публикации по теме Red team

Thursday, June 08, 2023

Бэкдоры в NLP

Простой и работающий подход к поиску бэкдоров в NLP - ложные корреляции

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Wednesday, July 07, 2021

Wednesday, May 27, 2026

Состязательное машинное обучение сегодня

Состязательное машинное обучение (СМО) представляет собой существенное препятствие для крупномасштабного внедрения искусственного интеллекта (ИИ) в критически важных с точки зрения безопасности средах. Хотя ранние исследования были сосредоточены на надежности алгоритмов, эта область превратилась в сложное пересечение вопросов безопасности, обеспечения и политики. В данной статье представлен всесторонний междисциплинарный обзор ландшафта СМО, охватывающий более 250 рецензируемых работ. Мы используем таксономию, ориентированную на жизненный цикл, которая сопоставляет векторы атак и механизмы защиты с конкретными этапами конвейера ИИ от сбора данных до развертывания, расширяя традиционную триаду конфиденциальности, целостности и доступности (CIA) за счет включения управления и регулирования. Мы выявляем критические пробелы в исследованиях, включая сертифицированную надежность для обработки естественного языка (NLP) и возникающие угрозы в генеративном ИИ. Для обоснования этих теоретических выводов на практике мы анализируем пять конкретных тематических исследований: автономные транспортные средства, медицинский ИИ, финансовые системы, обработка естественного языка (NLP) и Интернет вещей (IoT). Уникальность этого обзора заключается в том, что он преодолевает разрыв между академической литературой и промышленной практикой, сопоставляя технические результаты исследований в области противодействия отмыванию денег с новыми стандартами, включая структуру управления рисками в области ИИ NIST (RMF), MITRE ATLAS и ISO/IEC 42001. В заключение мы предлагаем дорожную карту для исследователей, практиков и регулирующих органов по созданию проверяемых, заслуживающих доверия и соответствующих требованиям систем ИИ. - Adversarial Machine Learning: A 20-Year Survey of Attacks, Defenses, and Standards

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Tuesday, August 19, 2014

Sunday, November 09, 2025

Нет веры ничему

Результаты бенчмаркинга всё больше определяют доверие, выбор и развертывание моделей LLM, однако эти оценки остаются уязвимыми к семантически эквивалентным состязательным возмущениям. Предыдущие исследования устойчивости к состязательным атакам в обработке естественного языка (NLP) делали акцент на текстовых атаках, которые одинаково влияют на многие модели, оставляя открытым вопрос о том, возможно ли выборочно ухудшить или улучшить производительность, минимально влияя на другие модели. Мы формализуем эту проблему и изучаем выборочные состязательные атаки на MMLU — широко используемый бенчмарк, предназначенный для измерения широких общих знаний языковой модели и способности к рассуждению по различным предметам. Используя канонические атаки, интегрированные в фреймворк TextAttack, мы вводим протокол для оценки селективности, разрабатываем пользовательское ограничение для повышения селективности атак и предлагаем конвейер суррогат-LLM, который генерирует выборочные возмущения. Эмпирически мы обнаруживаем, что существуют выборочные состязательные атаки, которые могут существенно изменить относительные рейтинги, ставя под сомнение справедливость, воспроизводимость и прозрачность оценки на основе таблицы лидеров. Наши результаты обосновывают необходимость использования отчётности с учётом возмущений и диагностики надёжности для оценки LLM и демонстрируют, что даже незначительные правки могут изменить сравнительные суждения. - Selective Adversarial Attacks on LLM Benchmarks

См. также другие публикации, посвященные LLM

Saturday, January 25, 2025

Tuesday, April 17, 2018

О сверточных сетях

Применение сверточных сетей для задач NLP. Переводной обзор.

Есть еще один пример - автоматическая генерация кода. В статье рассматриваются вопросы, связанные с использованием методов анализа данных применительно к программным репозиториям. И CNN здесь вполне употребимы.

См. также другие публикации по теме convolutional neural networks