Saturday, September 12, 2026

ИИ атакует

Когда атакует машина: как генеративный ИИ переписал правила кибервойны

За тридцать лет индустрия информационной безопасности пережила несколько технологических сдвигов, но ни один из них не менял расстановку сил так быстро, как генеративный ИИ. Раньше между появлением нового класса атак и его массовым применением проходили годы: злоумышленникам нужно было время, квалификация и инфраструктура. Сегодня этот барьер обрушился. Написать фишинговое письмо на безупречном русском, собрать досье на жертву, сгенерировать вариант вредоносного кода, обходящий сигнатурный детектор — всё это стало доступно человеку без глубокой технической подготовки и занимает минуты, а не недели. Рассмотрим, как эволюционировали методы кибератак с появлением ИИ.

Friday, September 11, 2026

Бэкдоры в ИИ-агентах

Агенты LLM с открытыми весами уязвимы для бэкдоров, установленных во время тонкой настройки, которые могут быть необнаружимы, если условия срабатывания никогда не выполняются во время тестирования. Предполагая, что защитники не знают существующего триггера, они не могут напрямую отменить его. Одна из стратегий дезактивации заключается в установке известного бэкдора (защитное отравление), а затем в его отмене, в надежде, что исходный неизвестный бэкдор будет удален в качестве побочного эффекта. Однако эта процедура имеет неопределенные результаты: исходный бэкдор может сохраниться, быть стерт или перенаправлен, среди прочих возможностей. Мы представляем структуру для изучения этой динамики в агентах, вызывающих инструменты, разделяя триггер, реакцию, учителя и метод тонкой настройки в ходе систематических экспериментов на AgentDyn. В 115 экспериментах только защитное отравление стирает ~56% исходных бэкдоров; последующая дезактивация затем приводит к удалению почти всех выживших, подтверждая, что распознавание триггера и вредоносное выполнение поведенчески различимы. Интересно, что наши эксперименты показывают, что вредоносные бэкдоры никогда не сохраняются при использовании различных триггеров того же общего типа, что и защитный бэкдор, после чего следует дезактивация путем разучивания. Совместная установка до четырех бэкдоров повышает устойчивость (удалено ~36%), однако дезактивация одного известного совместного бэкдора приводит к удалению 52 из 60 совместно содержащихся бэкдоров (87%). При визуализации внутренних структур модели после дезактивации с помощью J-линз мы подтверждаем, что, хотя дезактивация восстанавливает доброкачественные реакции LLM, следы первоначального осознания триггера сохраняются на промежуточных уровнях. - Backdoor Decontamination Dynamics in LLM Agents

См. также другие публикации, посвященные агентам

Thursday, September 10, 2026

Уязвимости в связке LLM и веб-приложений

Большие языковые модели все чаще интегрируются в веб-приложения посредством чат-ботов, конвейеров вызова инструментов и агентных рабочих процессов. В этих системах пользовательский ввод может влиять не только на генерируемый текст, но и на действия бэкэнда, такие как запросы к базе данных, HTTP-запросы, операции с файлами, рендеринг шаблонов или вызовы API. В этой статье представлены веб-атаки с использованием больших языковых моделей (LLM), класс атак, при которых контролируемый злоумышленником ввод преобразуется интегрированным в LLM приложением, а затем достигает традиционных приемников веб-приложений. Мы систематизируем эту поверхность атаки с помощью репрезентативных вариантов LLM2X, включая LLM2SQLi, LLM2XSS, LLM2SSTI, LLM2CommandInjection, LLM2IDOR, LLM2CSRF, LLM2XXE и LLM2 SSRF. Наш анализ показывает, что LLM обычно не создает саму лежащую в основе уязвимость; Скорее, он действует как посреднический слой, а в некоторых настройках с поддержкой инструментов — как дезориентированный заместитель, переносящий влияние злоумышленника в компоненты, которые доверяют контенту, сгенерированному моделью или на который влияет модель. В качестве экспериментального примера мы реализуем TicketOracle, веб-приложение на основе Flask, интегрированное с LLM, для оценки LLM2SSRF в пяти сценариях атак и семи LLM. Наши результаты показывают существенные различия в уязвимости в зависимости от модели, что предполагает, что эксплуатация зависит как от небезопасной архитектуры приложения, так и от поведения, специфичного для модели. В заключение мы предлагаем стратегии смягчения последствий на уровнях подсказки, модели, приложения и сети. - From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

См. также другие публикации, посвященные LLM

Wednesday, September 09, 2026

Fine tuning vs. RAG

Общее правило, которым руководствуются большинство специалистов: RAG в основном расширяет знания модели. Тонкая настройка в основном влияет на поведение выходных данных. - How to Fine-Tune an LLM: An End-to-End Guide

Tuesday, September 08, 2026

Вечные бэкдоры

Люди способны к стратегическому обману: в большинстве ситуаций они ведут себя полезно, но затем, получив возможность, резко меняют свое поведение, чтобы преследовать альтернативные цели. Если бы система ИИ научилась такой обманной стратегии, смогли бы мы обнаружить и устранить ее, используя современные методы обучения безопасности? Для изучения этого вопроса мы создаем демонстрационные примеры обманного поведения в больших языковых моделях (LLM). Например, мы обучаем модели, которые пишут безопасный код, когда в подсказке указано, что год 2023, но вставляют уязвимый код, когда указан год 2024. Мы обнаруживаем, что такое поведение типа «бэкдор» может быть устойчивым, так что его не удаляют стандартные методы обучения безопасности, включая контролируемую тонкую настройку, обучение с подкреплением и состязательное обучение (вызывание небезопасного поведения, а затем обучение его устранению). Поведение типа «бэкдор» наиболее устойчиво в самых больших моделях и в моделях, обученных создавать цепочку рассуждений о том, как обмануть процесс обучения, причем устойчивость сохраняется даже после удаления цепочки рассуждений. Кроме того, вместо удаления бэкдоров, мы обнаружили, что состязательное обучение может научить модели лучше распознавать триггеры своих бэкдоров, эффективно скрывая небезопасное поведение. Наши результаты показывают, что, как только модель начинает демонстрировать обманчивое поведение, стандартные методы могут оказаться неспособными устранить такой обман и создать ложное впечатление безопасности. - Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

См. также другие публикации, посвященные LLM

Monday, September 07, 2026

MS кибербез

Компания Microsoft представила свою первую модель ИИ для кибербезопасности, MAI-Cyber-1-Flash, которая, по утверждению компании, показала значительно лучшие результаты в обнаружении уязвимостей, чем её основные конкуренты.

MAI-Cyber-1-Flash, разработанная для выявления сложных уязвимостей в сложном коде, интегрирована в многоагентную систему идентификации и устранения уязвимостей MDASH от Microsoft.

MDASH объединяет более 100 специализированных агентов ИИ в рамках множества передовых и упрощенных моделей ИИ и использовалась для обнаружения множества уязвимостей в собственных кодовых базах технологического гиганта.

По данным Microsoft, тестирование в рамках системы оценки кибербезопасности CyberGym показало, что MAI-Cyber-1-Flash (в сочетании с MDASH и GPT-5.4) превзошла недавно выпущенную Google 3.5 Flash Cyber, OpenAI GPT-5.6 Sol и Anthropic Mythos 5 по обнаружению уязвимостей.

отсюда

Sunday, September 06, 2026

Friday, September 04, 2026

ИИ в атаке

Компания Booz Allen выпустила отчет «The Offensive Frontier: AI as the Attacker»

Отчет по документу Booz Allen «The Offensive Frontier: AI as the Attacker» (2026)

Согласно отчету, в 2026 году произошел критический сдвиг: ведущие модели ИИ (в частности, Anthropic's Claude Mythos) теперь способны автономно выполнять полный цикл кибератаки (от разведки до полного контроля над сетью) в реальных условиях. Это переводит ИИ из статуса инструмента хакера в статус самостоятельного оператора.

Booz Allen протестировала 18 передовых моделей (американских и китайских) по новому индексу Cyber Weapon Index (CWI). Ключевые результаты:
Лидер: Только одна модель (Anthropic Claude Mythos) получила наивысший балл, успешно пройдя все этапы атаки, включая создание эксплойтов для новых уязвимостей.
Широкое распространение способностей: Около двух третей протестированных моделей смогли самостоятельно получить первоначальный доступ к защищенной сети. Многие модели достигают этапов кражи учетных данных и горизонтального перемещения.
Отсутствие "национального" преимущества: Значительной разницы между возможностями американских и китайских моделей не выявлено. Ожидается, что большинство моделей достигнут полного потенциала в течение 6 месяцев.
Ключевая уязвимость: Все модели (кроме лидирующих) провалили тест на поиск реальной (новой) уязвимости в сложном коде, показав 0% результативность. Это создает временное окно для усиления защиты.

Критические факторы риска:
Значение "обвязки" (Attack Harness): Программное обеспечение, соединяющее модель с инструментами, может усилить возможности модели настолько, что менее продвинутая модель в "обвязке" сравняется с лидером. Это означает, что реальную угрозу представляет вся система ИИ (модель + инструменты + автономия), а не только сама модель.
Нестабильность ограничений (Guardrails): Отказ модели выполнять атаку может быть обойден изменением контекста задачи (например, использованием "специализированной" версии модели или сменой формулировки).
Слепые зоны оценки: Стандартные бенчмарки не измеряют операционные возможности модели в реальных атаках, что создает иллюзию безопасности.

Рекомендации для США
Документ предлагает три стратегических шага для достижения "кибер-превосходства" (Cyber Overmatch):

1. Агрессивно внедрять "контр-ИИ" (Counter-AI):

  • Перепроектировать киберзащиту для активного противодействия автономным атакующим (например, используя тактики обмана).
  • Встроить ИИ во все этапы защиты (обнаружение, реагирование) для перехода на машинную скорость.
  • *Результат в тестах*: Координированные "контр-ИИ" тактики снизили успешность атак более чем на 95%.

2. Ввести обязательные требования к готовности критической инфраструктуры:

  • Установить отраслевые стандарты и дедлайны для демонстрации устойчивости к ИИ-атакам.
  • Проводить регулярные учения с имитацией текущих ИИ-возможностей.
  • Сместить фокус с предотвращения вторжений на сдерживание и ограничение ущерба (Zero Trust, сегментация).

3. Постоянно отслеживать глобальный ландшафт ИИ-возможностей:

  • Создать национальную программу независимого тестирования моделей (включая зарубежные и открытые) в реалистичных сценариях.
  • Превращать данные тестирования в систему раннего предупреждения для корректировки оборонных стратегий.
  • Обеспечить контролируемый доступ защитников к передовым ИИ-инструментам для разработки средств защиты.

Прогноз развития:

  • Ближайшее время: Массовое распространение ИИ-атак, снижение порога входа для киберпреступников.
  • В течение месяцев: Появление "по требованию" эксплойтов для новых уязвимостей (zero-day).
  • 1-2 года: Возможный переход преимущества к защитникам, которые смогут использовать ИИ для упреждающей защиты.
  • 2-3 года: Появление самоулучшающихся моделей, способных адаптировать тактику атаки в режиме реального времени.

Заключительный вывод: Автономные ИИ-атаки больше не гипотетическая угроза. Будущее лидерство в киберпространстве достанется не тем, у кого больше ИИ, а тем, кто сможет быстрее адаптировать свои наступательные и оборонительные операции к новой реальности.

Thursday, September 03, 2026

И снова о регуляции ИИ

На встрече лидеров отрасли и министров торговли в Северной Каролине США призвали членов G20 занять невмешательскую позицию в регулирование ИИ и избегать создания правил для этой технологии. Цели США в значительной степени совпадают с мнением крупнейших мировых компаний, занимающихся ИИ, почти все из которых являются американскими. Они хотят меньшего регулирования во всем мире для своих быстрорастущих предприятий или хотят формировать правила по мере их написания. Требования федерального правительства могут нанести ущерб прибыли отрасли, если они замедлят выпуск новых моделей или побудят компании изменить характеристики своей продукции для решения проблем безопасности.

Советник США по технологиям Майкл Крациос, который является соорганизатором двухдневной встречи, призвал страны принять «Каролинские принципы». Страны, подписавшие соглашение, договорились избегать разработки совершенно новых правил для ИИ и вместо этого сосредоточиться на разработке правил для «новых» ситуаций, связанных с этой технологией.

/via Reuters

Monday, August 31, 2026

Крипто-промпт инъекция

Статические средства защиты классифицируют входные данные как текст; они не выполняют их. Злоумышленник отправляет зашифрованный текст вместе с ключевым материалом и инструкцией по его расшифровке, и модель выполняет эту расшифровку внутри своей собственной песочницы выполнения кода. Все, что потребовалось бы сканеру средства защиты, находится прямо на странице, но для восстановления открытого текста необходимо запустить PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки. В отличие от base64 или шифра подстановки, собственные веса модели также не могут использовать какой-либо короткий путь. Расшифрованные инструкции злоумышленника затем отображаются как результат выполнения кода, который модель только что запустила, внутри доверенного контекста выполнения, и не помечаются как недоверенные входные данные. Модель обрабатывает их как авторитетные. Выполнение во время выполнения преобразует данные, контролируемые злоумышленником, в доверенные инструкции, которые будет выполнять агент. Именно так атака получила свое название: криптография помогает создать доверенный контекст для агента.

А как модель получит эти зашифрованные данные? Например, будет читать какую-то веб-страницу, на которой будет размещен зашифрованный JSON. Тема инъекции подсказок для моделей будет вечной ...

Отсюда

Thursday, August 27, 2026

Стратегии улучшения робастности

Модели машинного обучения, в частности архитектуры глубокого обучения, демонстрируют высокую производительность в задачах прогнозирования, но остаются уязвимыми для атак с использованием состязательных методов. Цель данного исследования — повысить устойчивость сверточных нейронных сетей (CNN), глубоких нейронных сетей (DNN) и рекуррентных нейронных сетей (RNN), тем самым улучшив безопасность систем машинного обучения. Применяется трехэтапный подход. Во-первых, выполняется классификация безопасных образцов с использованием эталонного набора данных MNIST. Во-вторых, на обученные модели запускаются атаки с использованием состязательных методов, а именно Projected Gradient Descent (PGD), DeepFool (DF) и Fast Gradient Sign Method (FGSM), что приводит к значительному снижению производительности. На основе искаженных выходных данных, вызванных состязательными возмущениями, впоследствии создается модель обнаружения состязательных методов. В-третьих, для противодействия этим атакам используются различные стратегии защиты, включая состязательное обучение, защитную дистилляцию, шумоподавление на основе автокодировщика, ансамблевые методы и сжатие признаков, которые оцениваются с использованием стандартных метрик производительности и графического анализа. Результаты показывают, что в отсутствие механизмов защиты атаки PGD приводят к снижению точности примерно на 27% в CNN, на 83% в DNN и на 90% в RNN, демонстрируя серьезные уязвимости моделей. Однако при применении стратегий защиты все модели восстанавливаются до точности не менее 98,9%, при этом состязательное обучение улучшает производительность при атаке до 90%. Среди оцененных моделей CNN демонстрируют самую высокую базовую устойчивость, в то время как DNN и RNN в большей степени полагаются на механизмы защиты для поддержания производительности. Эти результаты предоставляют ценную информацию для разработки безопасных и отказоустойчивых систем машинного обучения, способных смягчать состязательные угрозы. - Enhanced Robustness in Neural Network Models against Adversarial Attacks and their Performance Analysis

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению