Showing posts sorted by relevance for query RL. Sort by date Show all posts
Showing posts sorted by relevance for query RL. Sort by date Show all posts

Wednesday, March 28, 2018

RL

Практическое применение Reinforcement Learning. Generally speaking, the goal in RL is learning how to map observations and measurements to a set of actions while trying to maximize some long-term reward.

P.S. см. также другие публикации по теме Обучения с подкреплением

Wednesday, October 02, 2019

Tuesday, February 17, 2026

Без времени

Системы глубокого обучения, обрабатывающие временные и последовательные данные, все чаще используются в критически важных для безопасности приложениях, включая мониторинг состояния здоровья, автономную навигацию и алгоритмическую торговлю. Однако эти системы обладают серьезной уязвимостью к атакам со стороны злоумышленников — тщательно разработанным возмущениям, которые вызывают систематическую неправильную классификацию, оставаясь при этом незаметными. В данной статье представлен всесторонний систематический обзор атак со стороны злоумышленников на системы классификации временных рядов, распознавания активности человека (HAR) и обучения с подкреплением (RL), основанный на анализе 127 статей, опубликованных в период с 2019 по 2025 год, в соответствии с рекомендациями PRISMA с документированной межэкспертной надежностью (κ = 0,83). Мы устанавливаем единую четырехмерную таксономию, различающую характеристики атак в зависимости от целевых модальностей (носимые датчики IMU, датчики WiFi/радара, распознавание на основе скелета, медицинские/финансовые временные ряды и агенты RL), стратегий возмущения, временного диапазона и уровней физической реализуемости. Наш количественный анализ выявляет серьезные базовые уязвимости — атаки FGSM снижают точность HAR с 95,1% до 3,4% в условиях «белого ящика», — при этом демонстрируя, что переносимость между датчиками значительно варьируется от 0% до 80% в зависимости от расположения на теле и модальности. Критически важно, что мы выявляем существенный разрыв между показателями успешности цифровых атак (85–98%) и физически подтвержденных атак, при этом подтверждение с помощью аппаратного моделирования демонстрирует 70–97% успеха только для Wi-Fi и радаров, в то время как физические атаки с использованием носимых IMU остаются полностью неподтвержденными. Мы проводим систематический анализ механизмов защиты, включая обучение с использованием состязательных методов, подходы, основанные на обнаружении, сертифицированные средства защиты, и ансамблевые методы, предлагая структуру Temporal AutoAttack (T-AutoAttack) для стандартизированной оценки адаптивных атак. Наш анализ показывает, что существующие средства защиты демонстрируют снижение производительности на 6–23% при адаптивных атаках, при этом сертифицированные методы показывают наименьший разрыв, но приводят к снижению точности на 15–30%. Мы также выявляем новые уязвимости в архитектурах HAR на основе трансформеров и в системах прогнозирования временных рядов на основе LLM, которые требуют срочного внимания. Обзор завершается составлением приоритетной дорожной карты исследований, в которой определены восемь критических пробелов с указанием конкретных наборов данных, оценочных конвейеров и сроков внедрения. Мы предлагаем практические рекомендации по внедрению для специалистов в области носимых HAR, Wi-Fi/радарного зондирования, систем обучения с подкреплением и новых временных приложений на основе LLM. Эта работа предлагает первое унифицированное решение, объединяющее исследования временных рядов и состязательных систем обучения с подкреплением, закладывая основы для разработки надежных временных систем ИИ, пригодных для реального применения в критически важных областях безопасности. - Temporal Adversarial Attacks on Time Series and Reinforcement Learning Systems: A Systematic Survey, Taxonomy, and Benchmarking Roadmap

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Friday, November 29, 2024

Автоматизация AI Red Team

Автоматизированный Red Teaming может обнаруживать редкие сбои модели и генерировать сложные примеры, которые можно использовать для обучения или оценки. Однако основная проблема в автоматизированном red teaming заключается в обеспечении того, чтобы атаки были как разнообразными, так и эффективными. Предыдущие методы обычно успешно оптимизировали либо разнообразие, либо эффективность, но редко и то, и другое. В этой статье мы предлагаем методы, которые позволяют автоматизированному red teaming генерировать большое количество разнообразных и успешных атак. Наш подход разбивает задачу на два этапа: (1) автоматизированные методы для генерации разнообразных целей атак и (2) генерация эффективных атак для этих целей. Хотя мы предоставляем несколько простых методов для генерации разнообразных целей, наш ключевой вклад заключается в обучении атакующего RL, который как следует этим целям, так и генерирует разнообразные атаки для этих целей. Во-первых, мы демонстрируем, что легко использовать большую языковую модель (LLM) для генерации разнообразных целей атакующего с подсказками и вознаграждениями для каждой цели, включая вознаграждения на основе правил (RBR) для оценки того, являются ли атаки успешными для конкретной цели. Во-вторых, мы демонстрируем, как обучение модели атакующего с помощью многошагового RL, где модель вознаграждается за создание атак, отличающихся от прошлых попыток, еще больше увеличивает разнообразие, оставаясь эффективной. Мы используем наш подход для создания как атак с подсказками, так и подсказок, вызывающих небезопасные ответы. В обоих случаях мы обнаруживаем, что наш подход способен генерировать высокоэффективные и значительно более разнообразные атаки, чем прошлые общие подходы red-teaming. - Diverse and Effective Red Teaming with Auto-generated Rewards and Multi-step Reinforcement Learning

Tuesday, February 03, 2026

ИИ для защиты спутниковых коммуникационных сетей

В данной статье рассматривается применение искусственного интеллекта (ИИ) для защиты спутниковых коммуникационных сетей с акцентом на выявление и предотвращение киберугроз. С быстрым развитием коммерческого космического сектора значение эффективной киберзащиты возросло благодаря растущей зависимости глобальной инфраструктуры от спутниковых технологий. В исследовании применяется структурированный сравнительный анализ методов ИИ по трём основным архитектурам спутников: геостационарной (GEO), низкой околоземной орбите (LEO) и гибридных системах. Методология основана на руководящих исследовательских вопросах и оценивает репрезентативные алгоритмы ИИ в контексте конкретных сценариев угроз, включая глушение, спуфинг, DDoS-атаки и перехват сигналов. Реальные случаи, такие как атака KA-SAT AcidRain и глушение Starlink, а также экспериментальные демонстрации противоглушения на основе RL и маршрутизации GNN/DQN, служат доказательствами практической применимости. Результаты подчёркивают как потенциал, так и ограничения ИИ-решений, показывая измеримые улучшения точности обнаружения, пропускной способности, снижения задержек и устойчивости к помехам. Представлены архитектурные подходы интеграции ИИ в спутниковую безопасность, а также обсуждаются их эффективность, компромиссы и возможность развертывания. - Artificial Intelligence in Satellite Network Defense: Architectures, Threats, and Security Protocols.

Tuesday, October 07, 2025

Атаки извлечения для LLM

Недавние исследования показали, что большие языковые модели (LLM) могут быть «обмануты» и выводить конфиденциальную информацию, включая данные для обучения, системные подсказки и персональные данные, под тщательно продуманными противодейственными подсказками. Существующие подходы к утечке конфиденциальной информации, основанные на «красных командах», либо основаны на ручных усилиях, либо сосредоточены исключительно на извлечении системных подсказок, что делает их неэффективными при серьёзных рисках утечки данных для обучения. Мы предлагаем LeakAgent, новый фреймворк «чёрного ящика» для «красных команд» для LLM. Наш фреймворк обучает LLM с открытым исходным кодом посредством обучения с подкреплением в качестве атакующего агента для генерации состязательных подсказок как для извлечения данных для обучения, так и для извлечения системных подсказок. Для достижения этого мы предлагаем новую функцию вознаграждения, обеспечивающую эффективное и детальное вознаграждение, и разрабатываем новые механизмы для баланса между исследованием и эксплуатацией в процессе обучения и повышения разнообразия состязательных подсказок. В ходе обширных исследований мы сначала показали, что LeakAgent значительно превосходит существующие подходы, основанные на правилах, при извлечении обучающих данных и автоматизированные методы в случае утечки системных подсказок. Мы также демонстрируем эффективность LeakAgent при извлечении системных подсказок из реальных приложений в хранилище GPT OpenAI. Мы также демонстрируем эффективность LeakAgent в обходе существующей защиты ограждений и его полезность для обеспечения лучшего выравнивания безопасности. Наконец, мы проверяем наши индивидуальные разработки посредством подробного исследования абляции. Мы публикуем наш код здесь https://github.com/rucnyz/LeakAgent. - LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage

См. также другие публикации, посвященные LLM