Monday, October 05, 2026

ИИ-агенты пентестинга

Agents4Pentest — новый класс автономных систем для тестирования на проникновение, основанных на больших языковых моделях (LLM), — стал быстрорастущим направлением исследований в области информационной безопасности. Несмотря на этот рост, в данной сфере до сих пор отсутствуют единая таксономия, систематическое понимание того, как происходила совместная эволюция архитектур агентов и методик их оценки (бенчмарков), а также четкое описание сохраняющихся пробелов в функциональных возможностях и надежности. В данном обзоре эти пробелы устраняются посредством систематического анализа 81 научной работы, опубликованной в период с 2023 по 2026 год. Мы классифицируем изученные материалы по шести категориям: оценочные бенчмарки, системы общего назначения, специализированные (доменно-ориентированные) фреймворки, системы на базе соревнований CTF (Capture The Flag), исследования в области защиты и обзорные работы. Кроме того, мы прослеживаем четыре этапа архитектурной эволюции: от агентов, способных рассуждать исключительно на основе текстовых данных, до агентов, обученных с использованием метода обучения с подкреплением и проверяемыми наградами (RLVR), и показываем, что каждый переход был обусловлен необходимостью преодоления конкретного ограничения функциональности. Наш анализ позволил сформулировать ряд ключевых выводов. Во-первых, внедрение RLVR ознаменовало переход от приобретения навыков путем имитации действий экспертов к самосовершенствованию на основе системы вознаграждений, что позволяет агентам находить ранее не описанные стратегии атак. Во-вторых, платформы CTF эволюционировали из тестовых полигонов в инфраструктуру двойного назначения, пригодную как для оценки агентов, так и для их обучения методами обучения с подкреплением. В-третьих, специализированные фреймворки повышают эффективность за счет механизмов адаптивной специализации, однако их преимущества зачастую ограничены узкими классами задач, а сравнение результатов между различными предметными областями затруднено из-за использования разных методик оценки. В-четвертых, сфера исследований расширяется за пределы автоматизации наступательных действий, охватывая вопросы защиты от состязательных атак и обеспечения соответствия требованиям безопасности. Для всех рассмотренных категорий мы выделяем три взаимосвязанные открытые проблемы: надежность оценки, ограниченная эффективность при выполнении многоэтапных сценариев атак и нехватка качественных данных для обучения. В целом, данный обзор предлагает единую таксономию, методологическую основу для сравнения систем класса Agents4Pentest и план дальнейших исследований в области автономных агентов для тестирования на проникновение. A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

См. также другие публикации, посвященные агентам

Sunday, October 04, 2026

Специальная форма косвенной инъекции

Агенты на базе ИИ действуют на основе запросов пользователя, используя внешние данные и выполняя операции в соответствии с контекстом агента. Предыдущие исследования безопасности таких агентов были сосредоточены главным образом на атаках типа «непрямая инъекция промпта» (indirect prompt injection, IPI). Наиболее изученной их разновидностью является инъекция инструкций (instruction injection), при которой неконтролируемые данные, управляемые злоумышленником, интерпретируются системой как команды. В ответ на это было предложено множество мер защиты, призванных предотвратить подобные атаки. В данной работе мы представляем новую категорию атак IPI — инъекцию данных в агента (agent data injection, ADI). Атаки ADI предполагают внедрение вредоносных данных, замаскированных под доверенные: например, критически важных для безопасности метаданных (идентификаторов ресурсов, сведений об источнике данных) или данных контекста агента (форматов вызова инструментов и ответов на них). В результате агенты непреднамеренно выполняют нежелательные действия, руководствуясь данными, контролируемыми злоумышленником. Последствия атак ADI схожи с последствиями инъекции инструкций, поскольку они также приводят к некорректной работе агентов и выполнению ими незапланированных операций. Несмотря на схожесть последствий, атаки ADI остаются недостаточно изученными и легко обходят существующие механизмы защиты от IPI. Мы обнаружили ряд критических уязвимостей в реальных агентах, позволяющих злоумышленнику проводить различные атаки: от произвольных кликов в веб-агентах (Claude в Chrome, Antigravity, Nanobrowser) до удаленного выполнения кода и атак на цепочку поставок в агентах для написания программного кода (Claude Code, Codex, Gemini CLI). Мы проанализировали уязвимость к ADI в готовых моделях и агентах на базе ИИ и установили, что этот тип атак эффективен как в отношении автономных больших языковых моделей (LLM), так и в системах, использующих агентов. ADI выявляет критический пробел в безопасности агентов, свидетельствующий о том, что в современных системах не соблюдается фундаментальный принцип защиты: доверенные данные не изолируются от недоверенных. - Agent Data Injection Attacks are Realistic Threats to AI Agents

См. также другие публикации, посвященные агентам

Saturday, October 03, 2026

О безопасности MCP

Серверы Model Context Protocol (MCP) стали неотъемлемым элементом связи больших языковых моделей (LLM) с внешними инструментами, источниками данных и средами выполнения. Однако наличие у них привилегированного доступа и роль связующего звена создают серьезные угрозы безопасности. Несмотря на существование множества методов обнаружения уязвимостей с использованием LLM, остается неясным, способны ли они различать на уровне семантики пары «уязвимый сервер MCP — исправленный сервер MCP», а не просто выявлять рискованные вызовы API. В данной работе мы представляем специализированный бенчмарк для оценки обнаружения уязвимостей в таких парах серверов MCP; он включает 75 пар инструментов (уязвимых и исправленных), сгенерированных моделью Gemini-1.5-Pro и прошедших ручную перекрестную проверку. Для оценки методов обнаружения мы используем метрику точности на парных образцах (Matched Pair Accuracy, MPA). Модель Claude Haiku-4.5 демонстрирует лучший показатель MPA — 0,853, тогда как GPT-5-mini показывает F1-меру 0,842, но MPA лишь 0,653; это свидетельствует о том, что традиционные метрики могут завышать эффективность обнаружения в парных сценариях. Наш бенчмарк открывает новые возможности для систематической и воспроизводимой оценки безопасности, ориентированной именно на протокол MCP. - Benchmarking MCP Vulnerability Detection from a Paired Evaluation Perspective

См. другие публикации, посвященные MCP

Friday, October 02, 2026

Атаки с помощью ИИ-агентов

Компания Gambit Security сообщает, что злоумышленник, движимый финансовой выгодой, использовал три инструмента на базе ИИ-агентов для взлома интернет-магазинов, кражи данных более 600 000 банковских карт и внедрения платежных скиммеров как минимум на 119 веб-сайтах. Кампания велась в период с июля по меньшей мере до 22 сентября; по оценкам Gambit, затраты злоумышленника на ИИ-сервисы и сопутствующие операции составили от 12 000 до 18 000 долларов. - отсюда

Что особенно интересно - отчет об этой атаке от Gambit включает уже технические подробности организации атак (в отличие от Anthropic и OpenAI, которые в своих отчетах об инцидентах ничего практического не указывали).

См. также другие публикации, посвященные агентам

Thursday, October 01, 2026

Вайб-кодинг в кибербезопасности

Что можно делать одним промптом. Коллективное исследование магистров кафедры Информационной безопасности факультета ВМК МГУ имени М.В. Ломоносова

В статье представлены результаты масштабного эксперимента, в котором команды студентов магистратуры ВМК МГУ имени М.В. Ломоносова в рамках курса по безопасности систем Интернета Вещей составляли программы классификации сетевого трафика с помощью больших языковых моделей (LLM). Использование моделей машинного (глубокого) обучения является классической историей для систем обнаружения вторжений. В качестве исходных данных на выбор предлагались доступные датасеты сайта Kaggle. Соответственно, на этом же сайте, вместе с датасетами можно было найти запрограммированные “вручную” модели, которые могли послужить базовыми примерами для сравнения с автоматическими решениями. Задача состояла в разработке подсказок (промптов), проверке их на нескольких LLM и, отдельно, проверке работы англоязычного и русскоязычного варианта подсказок. В целом, во всех проведенных экспериментах LLM работающие модели, которые не уступали по метрикам существующим “ручным” вариантам. Тем не менее, полученные результаты требовали проверки, равно как архитектурные решения, выбранные LLM, не всегда были оптимальными, а иногда и просто неверными, например, в части утечки данных. Это оставляет пока пространство для работы программистов (ML-инженеров).

Sok: безопасность ИИ-агентов

Агентные системы искусственного интеллекта, работающие на базе больших языковых моделей (LLM) и обладающие способностью к планированию, использованию инструментов, запоминанию и автономной деятельности, становятся мощными и гибкими платформами для автоматизации. Их способность автономно выполнять задачи в веб-среде, программных системах и физическом мире порождает новые, усиленные риски безопасности, отличные как от проблем безопасности традиционного ИИ, так и от вопросов защиты обычного программного обеспечения. В данном обзоре представлена таксономия угроз, характерных для агентного ИИ, рассмотрены современные бенчмарки и методики оценки, а также проанализированы стратегии защиты с технической и управленческой точек зрения. Мы обобщаем результаты текущих исследований и выделяем нерешенные задачи, стремясь содействовать разработке агентных систем, изначально проектируемых с учетом требований безопасности (secure-by-design). - Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

См. также другие публикации, посвященные агентам