Showing posts sorted by date for query rl. Sort by relevance Show all posts
Showing posts sorted by date for query rl. Sort by relevance Show all posts

Friday, August 14, 2026

Агент для red-team

1. Проблема и основная гипотеза
Проблема: Современные методы автоматического "краснокомандования" (red-teaming) для поиска инъекций промптов делятся на два класса, каждый со своими недостатками:
Методы на основе обучения с подкреплением (RL): Очень эффективны, но требуют огромного числа запросов к целевой модели для обучения и плохо переносят полученные навыки на новые модели.
Поисковые методы (search-based): Не требуют обучения, но начинают поиск атаки с нуля для каждого примера, не накапливая опыт, и поэтому значительно уступают RL-методам в эффективности.
Гипотеза: Можно создать агента, который будет накапливать знания об успешных атаках из предыдущего опыта, что позволит поисковым методам достичь эффективности RL-подходов.

2. Предлагаемое решение: PIMiner PIMiner — это агентная система, которая преобразует историю атак в многоуровневую иерархическую память, позволяющую накапливать и эффективно использовать знания.

Ключевые компоненты системы:
Библиотека стратегий (Strategy Library): Хранилище успешных паттернов атак в виде структурированных файлов, которые описывают, для каких моделей и задач стратегия работает, её шаблон, примеры и условия отказа. Это долговременная память системы.
Маршрутизатор стратегий (Strategy Router): Чтобы не загружать всю библиотеку в контекст (что дорого), маршрутизатор для каждого конкретного примера выбирает только Top-K наиболее релевантных стратегий, экономя контекст.
Модуль итеративной атаки (Iterative Attack Module): Непосредственно генерирует атаки, используя три уровня памяти:
Долговременная память: стратегии, выбранные маршрутизатором.
Внутридатасетная память (Intra-dataset): сжатый опыт атак на предыдущие примеры из того же набора данных и модели. Позволяет быстро адаптироваться к конкретной целевой модели.
Внутривыборочная память (Intra-sample): история предыдущих попыток для текущего конкретного примера. Помогает анализировать ошибки и уточнять атаку.
Агент-дигестер (Experience Digester): После завершения работы над всем набором данных, дигестер анализирует все успешные и неудачные атаки и обновляет библиотеку стратегий: добавляет новые стратегии, расширяет область применения существующих или уточняет условия, при которых они не работают.

3. Ключевые результаты экспериментов
Высокая эффективность: PIMiner достигает уровня успешности атак (ASR), сравнимого с лучшими RL-методами, значительно превосходя традиционные поисковые подходы. Например, на бенчмарке InjecAgent PIMiner достиг ASR=1.0 против GPT-4o-mini, GPT-4.1-nano и GPT-5-nano.
Отличная переносимость: Главное преимущество — стратегии, изученные PIMiner на одних моделях (например, GPT-5-nano, Claude-Haiku), напрямую переносятся на новые, ранее невиданные целевые модели (например, Gemini-2.5-Pro, GPT-5.1), без необходимости дообучения. В то время как RL-методы требуют переобучения для каждой новой модели.
Подтверждение гипотезы: Абляционные исследования показали, что каждый уровень памяти вносит вклад в успех, а их комбинация дает максимальный прирост эффективности (до 19.8%).
Экономичность: PIMiner требует всего около 10 итераций атаки на пример и обходится значительно дешевле в плане затрат на API по сравнению с RL-методами, которые могут требовать десятков тысяч запросов.

4. Основной вывод
PIMiner успешно преодолевает разрыв между поисковыми и RL-методами для автоматического поиска инъекций промптов. Система показывает, что накопление и структурирование знаний об атаках в иерархическую память позволяет эффективно искать уязвимости в новых LLM-агентах, не требуя дорогостоящего переобучения для каждой модели. Это делает PIMiner практичным инструментом для аудита безопасности агентных систем.

отсюда - Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming

См. также другие публикации, посвященные агентам

Tuesday, February 17, 2026

Без времени

Системы глубокого обучения, обрабатывающие временные и последовательные данные, все чаще используются в критически важных для безопасности приложениях, включая мониторинг состояния здоровья, автономную навигацию и алгоритмическую торговлю. Однако эти системы обладают серьезной уязвимостью к атакам со стороны злоумышленников — тщательно разработанным возмущениям, которые вызывают систематическую неправильную классификацию, оставаясь при этом незаметными. В данной статье представлен всесторонний систематический обзор атак со стороны злоумышленников на системы классификации временных рядов, распознавания активности человека (HAR) и обучения с подкреплением (RL), основанный на анализе 127 статей, опубликованных в период с 2019 по 2025 год, в соответствии с рекомендациями PRISMA с документированной межэкспертной надежностью (κ = 0,83). Мы устанавливаем единую четырехмерную таксономию, различающую характеристики атак в зависимости от целевых модальностей (носимые датчики IMU, датчики WiFi/радара, распознавание на основе скелета, медицинские/финансовые временные ряды и агенты RL), стратегий возмущения, временного диапазона и уровней физической реализуемости. Наш количественный анализ выявляет серьезные базовые уязвимости — атаки FGSM снижают точность HAR с 95,1% до 3,4% в условиях «белого ящика», — при этом демонстрируя, что переносимость между датчиками значительно варьируется от 0% до 80% в зависимости от расположения на теле и модальности. Критически важно, что мы выявляем существенный разрыв между показателями успешности цифровых атак (85–98%) и физически подтвержденных атак, при этом подтверждение с помощью аппаратного моделирования демонстрирует 70–97% успеха только для Wi-Fi и радаров, в то время как физические атаки с использованием носимых IMU остаются полностью неподтвержденными. Мы проводим систематический анализ механизмов защиты, включая обучение с использованием состязательных методов, подходы, основанные на обнаружении, сертифицированные средства защиты, и ансамблевые методы, предлагая структуру Temporal AutoAttack (T-AutoAttack) для стандартизированной оценки адаптивных атак. Наш анализ показывает, что существующие средства защиты демонстрируют снижение производительности на 6–23% при адаптивных атаках, при этом сертифицированные методы показывают наименьший разрыв, но приводят к снижению точности на 15–30%. Мы также выявляем новые уязвимости в архитектурах HAR на основе трансформеров и в системах прогнозирования временных рядов на основе LLM, которые требуют срочного внимания. Обзор завершается составлением приоритетной дорожной карты исследований, в которой определены восемь критических пробелов с указанием конкретных наборов данных, оценочных конвейеров и сроков внедрения. Мы предлагаем практические рекомендации по внедрению для специалистов в области носимых HAR, Wi-Fi/радарного зондирования, систем обучения с подкреплением и новых временных приложений на основе LLM. Эта работа предлагает первое унифицированное решение, объединяющее исследования временных рядов и состязательных систем обучения с подкреплением, закладывая основы для разработки надежных временных систем ИИ, пригодных для реального применения в критически важных областях безопасности. - Temporal Adversarial Attacks on Time Series and Reinforcement Learning Systems: A Systematic Survey, Taxonomy, and Benchmarking Roadmap

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Tuesday, February 03, 2026

ИИ для защиты спутниковых коммуникационных сетей

В данной статье рассматривается применение искусственного интеллекта (ИИ) для защиты спутниковых коммуникационных сетей с акцентом на выявление и предотвращение киберугроз. С быстрым развитием коммерческого космического сектора значение эффективной киберзащиты возросло благодаря растущей зависимости глобальной инфраструктуры от спутниковых технологий. В исследовании применяется структурированный сравнительный анализ методов ИИ по трём основным архитектурам спутников: геостационарной (GEO), низкой околоземной орбите (LEO) и гибридных системах. Методология основана на руководящих исследовательских вопросах и оценивает репрезентативные алгоритмы ИИ в контексте конкретных сценариев угроз, включая глушение, спуфинг, DDoS-атаки и перехват сигналов. Реальные случаи, такие как атака KA-SAT AcidRain и глушение Starlink, а также экспериментальные демонстрации противоглушения на основе RL и маршрутизации GNN/DQN, служат доказательствами практической применимости. Результаты подчёркивают как потенциал, так и ограничения ИИ-решений, показывая измеримые улучшения точности обнаружения, пропускной способности, снижения задержек и устойчивости к помехам. Представлены архитектурные подходы интеграции ИИ в спутниковую безопасность, а также обсуждаются их эффективность, компромиссы и возможность развертывания. - Artificial Intelligence in Satellite Network Defense: Architectures, Threats, and Security Protocols.

Tuesday, October 07, 2025

Атаки извлечения для LLM

Недавние исследования показали, что большие языковые модели (LLM) могут быть «обмануты» и выводить конфиденциальную информацию, включая данные для обучения, системные подсказки и персональные данные, под тщательно продуманными противодейственными подсказками. Существующие подходы к утечке конфиденциальной информации, основанные на «красных командах», либо основаны на ручных усилиях, либо сосредоточены исключительно на извлечении системных подсказок, что делает их неэффективными при серьёзных рисках утечки данных для обучения. Мы предлагаем LeakAgent, новый фреймворк «чёрного ящика» для «красных команд» для LLM. Наш фреймворк обучает LLM с открытым исходным кодом посредством обучения с подкреплением в качестве атакующего агента для генерации состязательных подсказок как для извлечения данных для обучения, так и для извлечения системных подсказок. Для достижения этого мы предлагаем новую функцию вознаграждения, обеспечивающую эффективное и детальное вознаграждение, и разрабатываем новые механизмы для баланса между исследованием и эксплуатацией в процессе обучения и повышения разнообразия состязательных подсказок. В ходе обширных исследований мы сначала показали, что LeakAgent значительно превосходит существующие подходы, основанные на правилах, при извлечении обучающих данных и автоматизированные методы в случае утечки системных подсказок. Мы также демонстрируем эффективность LeakAgent при извлечении системных подсказок из реальных приложений в хранилище GPT OpenAI. Мы также демонстрируем эффективность LeakAgent в обходе существующей защиты ограждений и его полезность для обеспечения лучшего выравнивания безопасности. Наконец, мы проверяем наши индивидуальные разработки посредством подробного исследования абляции. Мы публикуем наш код здесь https://github.com/rucnyz/LeakAgent. - LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage

См. также другие публикации, посвященные LLM

Friday, November 29, 2024

Автоматизация AI Red Team

Автоматизированный Red Teaming может обнаруживать редкие сбои модели и генерировать сложные примеры, которые можно использовать для обучения или оценки. Однако основная проблема в автоматизированном red teaming заключается в обеспечении того, чтобы атаки были как разнообразными, так и эффективными. Предыдущие методы обычно успешно оптимизировали либо разнообразие, либо эффективность, но редко и то, и другое. В этой статье мы предлагаем методы, которые позволяют автоматизированному red teaming генерировать большое количество разнообразных и успешных атак. Наш подход разбивает задачу на два этапа: (1) автоматизированные методы для генерации разнообразных целей атак и (2) генерация эффективных атак для этих целей. Хотя мы предоставляем несколько простых методов для генерации разнообразных целей, наш ключевой вклад заключается в обучении атакующего RL, который как следует этим целям, так и генерирует разнообразные атаки для этих целей. Во-первых, мы демонстрируем, что легко использовать большую языковую модель (LLM) для генерации разнообразных целей атакующего с подсказками и вознаграждениями для каждой цели, включая вознаграждения на основе правил (RBR) для оценки того, являются ли атаки успешными для конкретной цели. Во-вторых, мы демонстрируем, как обучение модели атакующего с помощью многошагового RL, где модель вознаграждается за создание атак, отличающихся от прошлых попыток, еще больше увеличивает разнообразие, оставаясь эффективной. Мы используем наш подход для создания как атак с подсказками, так и подсказок, вызывающих небезопасные ответы. В обоих случаях мы обнаруживаем, что наш подход способен генерировать высокоэффективные и значительно более разнообразные атаки, чем прошлые общие подходы red-teaming. - Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning

Wednesday, October 02, 2019

Wednesday, March 28, 2018

RL

Практическое применение Reinforcement Learning. Generally speaking, the goal in RL is learning how to map observations and measurements to a set of actions while trying to maximize some long-term reward.

P.S. см. также другие публикации по теме Обучения с подкреплением