Friday, October 02, 2026

Атаки с помощью ИИ-агентов

Компания Gambit Security сообщает, что злоумышленник, движимый финансовой выгодой, использовал три инструмента на базе ИИ-агентов для взлома интернет-магазинов, кражи данных более 600 000 банковских карт и внедрения платежных скиммеров как минимум на 119 веб-сайтах. Кампания велась в период с июля по меньшей мере до 22 сентября; по оценкам Gambit, затраты злоумышленника на ИИ-сервисы и сопутствующие операции составили от 12 000 до 18 000 долларов. - отсюда

Что особенно интересно - отчет об этой атаке от Gambit включает уже технические подробности организации атак (в отличие от Anthropic и OpenAI, которые в своих отчетах об инцидентах ничего практического не указывали).

См. также другие публикации, посвященные агентам

Thursday, October 01, 2026

Вайб-кодинг в кибербезопасности

Что можно делать одним промптом. Коллективное исследование магистров кафедры Информационной безопасности факультета ВМК МГУ имени М.В. Ломоносова

В статье представлены результаты масштабного эксперимента, в котором команды студентов магистратуры ВМК МГУ имени М.В. Ломоносова в рамках курса по безопасности систем Интернета Вещей составляли программы классификации сетевого трафика с помощью больших языковых моделей (LLM). Использование моделей машинного (глубокого) обучения является классической историей для систем обнаружения вторжений. В качестве исходных данных на выбор предлагались доступные датасеты сайта Kaggle. Соответственно, на этом же сайте, вместе с датасетами можно было найти запрограммированные “вручную” модели, которые могли послужить базовыми примерами для сравнения с автоматическими решениями. Задача состояла в разработке подсказок (промптов), проверке их на нескольких LLM и, отдельно, проверке работы англоязычного и русскоязычного варианта подсказок. В целом, во всех проведенных экспериментах LLM работающие модели, которые не уступали по метрикам существующим “ручным” вариантам. Тем не менее, полученные результаты требовали проверки, равно как архитектурные решения, выбранные LLM, не всегда были оптимальными, а иногда и просто неверными, например, в части утечки данных. Это оставляет пока пространство для работы программистов (ML-инженеров).

Sok: безопасность ИИ-агентов

Агентные системы искусственного интеллекта, работающие на базе больших языковых моделей (LLM) и обладающие способностью к планированию, использованию инструментов, запоминанию и автономной деятельности, становятся мощными и гибкими платформами для автоматизации. Их способность автономно выполнять задачи в веб-среде, программных системах и физическом мире порождает новые, усиленные риски безопасности, отличные как от проблем безопасности традиционного ИИ, так и от вопросов защиты обычного программного обеспечения. В данном обзоре представлена таксономия угроз, характерных для агентного ИИ, рассмотрены современные бенчмарки и методики оценки, а также проанализированы стратегии защиты с технической и управленческой точек зрения. Мы обобщаем результаты текущих исследований и выделяем нерешенные задачи, стремясь содействовать разработке агентных систем, изначально проектируемых с учетом требований безопасности (secure-by-design). - Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

См. также другие публикации, посвященные агентам

Wednesday, September 30, 2026

Экзистенциальные риски для человечества

Компания Anthropic (создатель ИИ-модели Claude) в проспекте к IPO предупредит инвесторов, что передовые модели искусственного интеллекта могут представлять экзистенциальные риски для человечества. Описанию факторов риска посвящено около 80 из 261 страницы документа, тогда как на описание бизнеса пришлось 48. Разработчик указывает, что ИИ может демонстрировать поведение, направленное на самосохранение, пытаться противостоять отключению, скрывать информацию и прибегать к шантажу

/via Reuters.

Из жизни ИИ-агентов

1. Еще один стандарт для ИИ-агентов - плагины. Расширение возможностей агентов с помощью плагинов, созданных на основе повторно используемых компонентов. Эту технологию поддерживают OpenAI, Microsoft, Cursor и AWS, но не Google или Anthropic.

2. MCP теперь stateless. Как и HTTP.

См. также другие публикации, посвященные агентам

Tuesday, September 29, 2026

Атаки на приватные данные

Объяснения в машинном обучении раскрывают поведение модели за пределами прогнозов, создавая поверхности атаки для обеспечения конфиденциальности модели и защиты данных. Мы систематизируем 25 исследований, которые используют объяснения для извлечения модели, вывода принадлежности и инверсии модели, рассматривая вывод атрибутов как частичную инверсию. Существующие работы часто маркируются только как «черный» или «белый ящик», скрывая существенные различия в том, какой сигнал объяснения достигает противника. Поэтому мы разделяем знания модели и получение объяснений и выделяем пять путей: раскрытие со стороны цели, получение со стороны злоумышленника, вторичное раскрытие, привилегированный доступ и раскрытие глобальных артефактов. На этих путях объяснения снижают затраты на извлечение, раскрывают сигналы принадлежности с помощью статистики объяснений, расстояния доступа, и управляемой объяснениями устойчивости, а также поддерживают пространственную или алгебраическую реконструкцию частных входных данных. Мы сравниваем системные и модели угроз, сигналы объяснений, вспомогательные знания, целевые модели, модальности, бюджеты запросов, метрики оценки, сообщаемую производительность и средства защиты. Наш анализ показывает, что ни одно семейство объяснений не является одинаково небезопасным, и ни одна защита не является одинаково эффективной. Риск зависит от того, какой сигнал раскрывается, как он получен, какой актив является целью и что злоумышленник уже знает. Мы утверждаем, что конфиденциальность объяснений следовательно, должна оцениваться как проблема раскрытия информации от начала до конца, при этом средства защиты должны соответствовать пути получения информации и защищаемому активу. - SoK: Privacy Attacks on Machine Learning via Explainable AI

Monday, September 28, 2026

Китайский суд

Верховный народный суд издал «Законодательные заключения по разрешению споров, касающихся искусственного интеллекта». Из Google-перевода:

«Заключение» — это первый судебный документ, касающийся искусственного интеллекта, вынесенный высшим судебным органом страны, и он представляет собой «китайскую судебную мудрость», способствующую позитивному и этичному развитию искусственного интеллекта в глобальном масштабе. В процессе подготовки «Заключения» получили мощную поддержку и помощь от соответствующих центральных правительственных ведомств, представителей индустрии искусственного интеллекта, экспертов, ученых и других слоев общества. Можно сказать, что «Заключение» является одновременно обобщением опыта судебной практики и кульминацией мудрости всех слоев общества.

Руководствуясь идеями Си Цзиньпина о социализме с китайской спецификой в новую эпоху, мы будем всесторонне реализовывать его идеи о верховенстве права, добросовестно воплощать в жизнь важные идеи генерального секретаря Си Цзиньпина о построении сильной кибердержавы, глубоко осознавать, что искусственный интеллект является важной движущей силой нового витка технологической революции и промышленной трансформации, придерживаться принципа равного внимания к развитию и безопасности, а также сочетать продвижение инноваций с управлением в соответствии с законом. Мы будем справедливо и беспристрастно рассматривать дела, касающиеся споров об искусственном интеллекте, в соответствии с законом, содействовать повышению безопасности, надежности, управляемости и справедливости применения технологий искусственного интеллекта, а также предоставлять надежные судебные услуги и гарантии для всестороннего продвижения строительства сильного государства и великого дела национального возрождения посредством модернизации в китайском стиле.

Регулирование в соответствии с законами и нормативными актами таких действий, как «замена лиц и имитация голоса с помощью ИИ» и «воскрешение умерших с помощью ИИ», которые нарушают права личности посредством генеративного искусственного интеллекта. Использование генеративного искусственного интеллекта для обработки имени, портрета и т. д. конкретного физического лица или умершего лица не должно нарушать законы и нормативные акты, а также противоречить общественному порядку и нормам морали. Если иное не предусмотрено законом, если без согласия физического лица используется искусственный интеллект для обработки имени, портрета и т. д. физического лица с целью создания виртуального цифрового изображения, позволяющего идентифицировать это физическое лицо, и это изображение используется и публикуется, и физическое лицо заявляет о нарушении им его прав личности, таких как право на его имя и портрет, Народный суд должен поддержать такие заявления в соответствии с законом. Если иное не предусмотрено законом, и если без согласия физического лица голос физического лица используется в качестве учебного материала для имитации тембра, тона и манеры произношения этого физического лица с целью создания синтетического человеческого голоса, способного идентифицировать это физическое лицо, и физическое лицо заявляет о нарушении им его прав на голос, Народный суд должен поддержать такие заявления в соответствии с законом. Если лицо манипулирует созданным синтетическим виртуальным цифровым изображением или голосом, способным идентифицировать конкретное физическое лицо, с целью совершения неправомерных действий или публикации ложных заявлений, тем самым снижая социальную оценку этого физического лица или других лиц, Народный суд должен определить, что это представляет собой нарушение права на репутацию в соответствии с законом. Если лицо использует технологию искусственного интеллекта для создания или использования виртуального цифрового изображения умершего без разрешения, что приводит к нарушению имени, образа или репутации умершего, и близкие родственники умершего требуют привлечения виновного к гражданской ответственности в соответствии со статьей 994 Гражданского кодекса, Народный суд обязан поддержать такое требование в соответствии с законом.

Правовое определение гражданской ответственности за нарушение прав на персональную информацию в процессе обучения искусственного интеллекта. Обработка персональной информации, добровольно предоставленной лицом или уже предоставленной в рамках закона в разумных пределах для обучения модели искусственного интеллекта, и при условии, что лицо явно не отказалось от нее, как правило, не считается нарушением прав на персональную информацию. Если это оказывает существенное влияние на права лица, необходимо получить согласие лица в соответствии с законом. При определении разумных пределов следует всесторонне учитывать такие факторы, как цель обработки персональной информации, необходимость и целесообразность функционирования модели, тип и степень конфиденциальности обрабатываемой персональной информации, ее потенциальное влияние на права лица, контекст, в котором раскрывается информация, и разумно предвидимый объем использования. (vii) Разумно определить гражданско-правовую ответственность поставщиков услуг генеративного искусственного интеллекта. Если контент, автоматически генерируемый генеративным искусственным интеллектом, нарушает права на репутацию, право на неприкосновенность частной жизни или другие личные права других лиц, и поставщик услуг генеративного искусственного интеллекта не принимает необходимых мер, таких как прекращение генерации контента, нарушающего авторские права, после получения уведомления от правообладателя, он несет гражданско-правовую ответственность за причиненный ущерб в соответствии с законом. Уведомление должно включать предварительные доказательства нарушения и достоверную информацию о личности правообладателя. Если пользователь сети злонамеренно побуждает генеративный искусственный интеллект к генерации контента, нарушающего авторские права, и причиняет вред другим лицам, вводя подсказки, нарушающие авторские права, пользователь сети несет гражданско-правовую ответственность в соответствии с законом; Если после уведомления со стороны правообладателя поставщик услуг генеративного искусственного интеллекта не принимает необходимых мер, таких как прекращение генерации контента, нарушающего авторские права, и блокировка соответствующих инструкций по генерации, и правообладатель требует от пользователя сети и поставщика услуг генеративного искусственного интеллекта привлечения к гражданской ответственности в соответствии со статьей 1195 Гражданского кодекса, народный суд должен поддержать такое требование в соответствии с законом.

В случаях, когда производители или продавцы транспортных средств делают ложные или вводящие в заблуждение заявления относительно уровня автоматизации, интеллекта, производительности или использования автономных транспортных средств или транспортных средств с функциями помощи водителю, тем самым нанося ущерб законным правам и интересам потребителей, и потребители требуют от производителей или продавцов транспортных средств привлечения к гражданской ответственности в соответствии с Гражданским кодексом, Законом о защите прав потребителей и другими соответствующими законами, Народный суд должен поддержать такое требование в соответствии с законом. Для установления причины дорожно-транспортного происшествия народный суд может потребовать от производителя, продавца или оператора транспортного средства, или иного лица, контролирующего данные, предоставить в необходимом объеме достоверные и полные записи о событиях автономного и вспомогательного вождения, а также другие данные, необходимые для установления фактов дела.

Полный текст перевода есть здесь

Sunday, September 27, 2026

Публикации по теме Искусственный интеллект в кибербезопасности 27.09.2026

Вопросы безопасности систем ИИ рассматриваются в двух магистерских программах факультета ВМК МГУ имени М.В. Ломоносова: Искусственный интеллект в кибербезопасности и Кибербезопасность. Ниже приведен список публикаций, подготовленных в процессе реализации этих программ по состоянию на 27.09.2026

Ильюшин Е. А., Намиот Д. Е. An approach to the automatic enhancement of the robustness of ml models to external influences on the example of the problem of biometric speaker identification by voice // International Journal of Open Information Technologies. — 2021. — Vol. 9, no. 6. — P. 11–19.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Текущие академические и индустриальные проекты, посвященные устойчивому машинному обучению // International Journal of Open Information Technologies. — 2021. — Т. 9, № 10. — С. 35–46.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Основания для работ по устойчивому машинному обучению // International Journal of Open Information Technologies. — 2021. — Т. 9, № 11. — С. 68–74.

Намиот Д. Е., Ильшин Е. А., Чижов И. В. Военные применения машинного обучения // International Journal of Open Information Technologies. — 2022. — Т. 10, № 1. — С. 69–76.

Ильюшин Е. А., Намиот Д. Е., Чижов И. В. Атаки на системы машинного обучения – общие проблемы и методы // International Journal of Open Information Technologies. — 2022. — Т. 10, № 3. — С. 17–22.

Namiot D., Ilyushin E. On monitoring of machine learning models // Distributed Computer and Communication Networks: Control, Computation, Communications (DCCN-2022) : материалы XXV международной научной конференции: Москва, 26–30 сентября 2022 года / под общ. ред. В. М. Вишневского и К. Е. Самуйлова. — РУДН Москва: 2022. — P. 150–157.

Namiot D., Ilyushin E., Chizhov I. On a formal verification of machine learning systems // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 5. — P. 30–34.

Huayu L., Namiot D. A survey of adversarial attacks and defenses for image data on deep learning // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 5. — P. 9–16.

Намиот Д., Ильюшин Е., Пилипенко О. Доверенные платформы искусственного интеллекта // International Journal of Open Information Technologies. — 2022. — Т. 10, № 7. — С. 119–127.

Намиот Д., Ильюшин Е. Порождающие модели в машинном обучении // International Journal of Open Information Technologies. — 2022. — Т. 10, № 7. — С. 101–118.

Биджиев Т. М., Намиот Д. Е. Исследование существующих подходов к встраиванию вредоносного программного обеспечения в искусственные нейронные сети // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 21–31.

Намиот Д. Е., Ильюшин Е. А. Об устойчивости и безопасности систем искусственного интеллекта // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 126–134.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Искусственный интеллект и кибербезопасность // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 135–147.

Stroeva E., Tonkikh A. Methods for formal verification of artificial neural networks: A review of existing approaches // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 10. — P. 3.

Намиот Д., Ильюшин Е. Мониторинг сдвига данных в моделях машинного обучения // International Journal of Open Information Technologies. — 2022. — Т. 10, № 12. — С. 84–93.

Костюмов, Василий Владимирович. "Обзор и систематизация атак уклонением на модели компьютерного зрения." International Journal of Open Information Technologies 10.10 (2022): 11-20.

Намиот Д. Е., Ильюшин Е. А. О причинах неудач проектов машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 1. — С. 60–69.

Намиот Д. Е. Введение в атаки отравлением на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 3. — С. 58–68.

Namiot D. E., Ilyushin E., Chizhov I. On the practical generation of counterfactual examples // Труды Института системного анализа Российской академии наук. — 2023. — Vol. 73, no. 1. — P. 73–81.

Junzhe S., Namiot D. E. A survey of model inversion attacks and countermeasures // Труды Института системного анализа Российской академии наук. — 2023. — Vol. 73, no. 1. — P. 82–93.

Junzhe S., Namiot D. A survey of the implementations of model inversion attacks // Communications in Computer and Information Science. — 2023. — Vol. 1748. — P. 3–16.

Намиот Д. Е. Схемы атак на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 5. — С. 68–86.

On the evasion attack detector / L. Huayui, V. Kostyumov, O. Pilipenko, D. Namiot // DCCN 2023. Материалы конференции. — ИПУ РАН Москва: 2023. — P. 183–188.

Junzhe S., Namiot D. On the machine learning models inversion attack detector // DCCN 2023. Материалы конференции. — ИПУ РАН Москва: 2023. — P. 194.

Lozinskii I., Kostyumov V., Stroeva E. Extraction of trigger and mask from poisoned data using modified activation clustering and neural cleanse methods // International Journal of Open Information Technologies. — 2023. — Vol. 11, no. 7. — P. 1

Чехонина, Екатерина Андреевна, and Василий Владимирович Костюмов. "ОБЗОР СОСТЯЗАТЕЛЬНЫХ АТАК И МЕТОДОВ ЗАЩИТЫ ДЛЯ ДЕТЕКТОРОВ ОБЪЕКТОВ." International Journal of Open Information Technologies 11.7 (2023): 11-20.

Пришлецов Д. Е., Пришлецов С. Е., Намиот Д. Е. Камуфляж как состязательные атаки на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 9. — С. 41–49.

Намиот Д. Е., Зубарева Е. В. О работе ai red team // International Journal of Open Information Technologies. — 2023. — Т. 11, № 10. — С. 130–139.

Намиот Д. Е., Ильюшин Е. А. Доверенные платформы искусственного интеллекта: сертификация и аудит // International Journal of Open Information Technologies. — 2024. — Т. 12, № 1. — С. 43–60.

Киржинов Д. А., Ильюшин Е. А. Сравнительный анализ алгоритмов атак и защиты на графовые архитектуры ИНС // International Journal of Open Information Technologies. — 2024. — Т. 12, № 2.

Намиот Д. Е., Романов В. Ю. Об улучшении робастности моделей машинного обучения // International Journal of Open Information Technologies. — 2024. — Т. 12, № 3. — С. 88–98.

Junzhe S., Namiot D. On real-time model inversion attacks detection // Lecture Notes in Computer Science. — 2024. — Vol. 14123. — P. 56–67.

Мударова Р. М., Намиот Д. Е. Противодействие атакам типа инъекция подсказок на большие языковые модели // International Journal of Open Information Technologies. — 2024. — Т. 12, № 5. — С. 39–48.

Намиот Д. Е., Ильюшин Е. А. Искусственный интеллект в кибербезопасности: поиск вредоносного программного обеспечения // International Journal of Open Information Technologies. — 2024. — Т. 12, № 6. — С. 143–149.

Lebed, S. V., et al. "Large Language Models in Cyberattacks." Doklady Mathematics. Vol. 110. No. Suppl 2. Moscow: Pleiades Publishing, 2024.

Селевенко Р. М., Строева Е. Н. Исследование и разработка алгоритма формальной верификации и метрики оценки качества на основе методов понижения размерности ИНС // INJOIT. — 2024. — Т. 12, № 6. — С. 2.

Биджиев Т. М., Намиот Д. Е. Атаки на модели машинного обучения, основанные на фреймворке pytorch // Автоматика и телемеханика. — 2024. — № 3. — С. 38–50.

Намиот Д. Е., Ильюшин Е. А. О сертификации систем искусственного интеллекта // Физика элементарных частиц и атомного ядра. — 2024. — Т. 55, № 3. — С. 530–536.

Намиот Д. Е., Куприяновский В. П., Пичугов А. А. Состязательные атаки для автономных транспортных средств // International Journal of Open Information Technologies. — 2024. — Т. 12, № 7. — С. 139–149.

Намиот Д. Е. О кибератаках с помощью систем Искусственного интеллекта // International Journal of Open Information Technologies. — 2024. — Т. 12, № 9. — С. 132–141.

Воробьев, Егор Александрович. "Анализ состязательных атак на системы сегментации изображений." International Journal of Open Information Technologies 12.10 (2024): 1-25.

Намиот Д. Е., Ильюшин Е. А. О киберрисках генеративного Искусственного Интеллекта // International Journal of Open Information Technologies. — 2024. — Т. 12, № 10. — С. 109–119.

Порывай, Максим Викторович. "Сравнительное исследование методов естественной аугментации изображений." International Journal of Open Information Technologies 12.10 (2024): 26-33.

Герасименко, Денис Валерьевич, and Дмитрий Евгеньевич Намиот. "Извлечение тренировочных данных: Риски и решения в контексте безопасности LLM." International Journal of Open Information Technologies 12.11 (2024): 9-19.

Костиков, Егор Вячеславович. "Методы анализа логов Sysmon для обнаружения киберугроз." International Journal of Open Information Technologies 12.11 (2024): 25-34.

Намиот Д. Е., Ильюшин Е. А. Архитектура LLM агентов //International Journal of Open Information Technologies. – 2025. – Т. 13. – №. 1. – С. 67-74.

Воробьев Е. А., Намиот Д. Е. Состязательное тестирование моделей сегментации изображений // Программная инженерия. — 2025. — Т. 16, № 4. — С. 190–198.

Намиот, Д. Е., and Е. А. Ильюшин. "Об оценке доверия к системам Искусственного интеллекта." International Journal of Open Information Technologies 13.3 (2025): 75-90.

Хамзаева, М. А., and О. Р. Лапонина. "Повышение устойчивости к состязательным атакам моделей машинного обучения для обнаружения межсайтового выполнения сценариев." International Journal of Open Information Technologies 13.6 (2025): 25-33.

Бербер, Д. В., and О. Р. Лапонина. "Разработка подходов к увеличению устойчивости моделей машинного обучения для обнаружения распределенных атак отказа обслуживания." International Journal of Open Information Technologies 13.6 (2025): 16-24.

Егорова, Е. С., and О. Р. Лапонина. "Состязательное тестирование моделей машинного обучения, предназначенных для обнаружения SQL-инъекций." International Journal of Open Information Technologies 13.6 (2025): 34-41.

Лапонина, О. Р., and Р. Н. Костин. "Разработка программного обеспечения моделирования угроз для систем на базе LLM-агентов." International Journal of Open Information Technologies 13.6 (2025): 132-146.

Намиот, Д. Е. "Что LLM знает о кибербезопасности." International Journal of Open Information Technologies 13.7 (2025): 37-46.

Намиот, Д. Е. "Искусственный Интеллект в. Кибербезопасности. Хроника. Выпуск 1." International Journal of Open Information Technologies 13.9 (2025): 34-42.

Намиот, Д. Е., and Е. А. Ильюшин. "О кибербезопасности ИИ-агентов." International Journal of Open Information Technologies 13.9 (2025): 13-24.

Егоров, М. Э., et al. "Объяснения моделей машинного обучения и состязательные атаки." International Journal of Open Information Technologies 13.9 (2025): 50-59.

Намиот, Д. Е., and Е. А. Ильюшин. "Уязвимости экосистемы MCP." International Journal of Open Information Technologies 13.10 (2025): 74-82.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 2." International Journal of Open Information Technologies 13.10 (2025): 58-67.

Poryvai, Maxim, and Dmitry Namiot. "On Natural Image Augmentation to Increase Robustness of Machine Learning Models." 2025 International Russian Automation Conference (RusAutoCon). IEEE, 2025.

Namiot D., Zubareva E. On open datasets for llm adversarial testing // Communications in Computer and Information Science. — 2025. — Vol. 2641. — P. 137–148. 

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 3." International Journal of Open Information Technologies 13.11 (2025): 169-179.

Maloyan, Narek, Bislan Ashinov, and Dmitry Namiot. "Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks."  arXiv preprint arXiv:2505.13348 (2025).

Maloyan, Narek, and Dmitry Namiot. "Adversarial Attacks on LLM-as-a-Judge Systems: Insights from Prompt Injections." arXiv preprint arXiv:2504.18333 (2025).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 4." International Journal of Open Information Technologies 14.1 (2026): 81-94.

Maloyan, Narek, and Dmitry Namiot. "Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems." arXiv preprint arXiv:2601.17548 (2026).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 5." International Journal of Open Information Technologies 14.2 (2026): 47-57.

Maloyan, Narek, and Dmitry Namiot. "Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents." arXiv preprint arXiv:2601.17549 (2026).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 6." International Journal of Open Information Technologies 14.3 (2026): 76-86.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 7." International Journal of Open Information Technologies 14.5 (2026): 43-56.

Евграфов, Владимир Андреевич, Маратович Нутфуллин Булат, and Дмитрий Евгеньевич Намиот. "Методы атак и защиты в агентных системах на основе больших языковых моделей." International Journal of Open Information Technologies 14.5 (2026): 1-8.

Namiot, Dmitry. "On the AI Agents Audit Model." 2026 International Russian Smart Industry Conference (SmartIndustryCon). IEEE2026.

Namiot, Dmitry Evgenyevich, and Valery Alexandrovich Vasenin. "Осведомленность о фишинге–вопросы обучения." Современные информационные технологии и ИТ-образование 21.2 (2025): 221-229.

Kuzmenko, Ilya Dmitrievich, Dmitry Evgenyevich Namiot, and Valery Alexandrovich Vasenin.. "Методы обнаружения дипфейков в видеоконференциях в реальном времени." Современные информационные технологии и ИТ-образование 21.2 (2025): 204-220.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 8." International Journal of Open Information Technologies 14.6 (2026): 53-64.

Maloyan, Narek, and Dmitry Namiot. "Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents." International Journal of Open Information Technologies 14.6 (2026): 1-8.

Тарасов, Д. Д., and О. Р. Лапонина. "Повышение эффективности состязательных атак на модель прогнозирования трафика TGC-LSTM." International Journal of Open Information Technologies 14.6 (2026): 23-31.

Шустова, Е. Д., and О. Р. Лапонина. "Состязательные атаки на модели обнаружения фишинга на основе URL-адресов." International Journal of Open Information Technologies 14.6 (2026): 32-42.

Хитрова, А. С., and О. Р. Лапонина. "Устойчивость сессионных рекомендательных систем к атакам отравления обучающей выборки." International Journal of Open Information Technologies 14.6 (2026): 43-52.

Лычева, Е. О., and О. Р. Лапонина. "Разработка механизма динамического доверия для защиты веб-сессий в архитектуре ZeroTrust." International Journal of Open Information Technologies  14.6 (2026): 162-170.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 9." International Journal of Open Information Technologies 14.7 (2026): 183-195.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 10." International Journal of Open Information Technologies 14.7 (2026): 108-122.

Saturday, September 26, 2026

Просто, но эффективно

Инъекция промптов (prompt injection) признана серьезной угрозой безопасности для ИИ-агентов, взаимодействующих с ненадежными внешними данными, такими как веб-сайты, документы и электронные письма. Предыдущие исследования показали, что в текстовой сфере атаки методом «черного ящика» (black-box) позволяют достичь практически стопроцентной эффективности (ASR). Однако в области обработки изображений существующие методы визуальной инъекции промптов значительно менее эффективны при попытках спровоцировать передовые коммерческие мультимодальные языковые модели (VLM) на действия, способные нанести существенный вред. Добиться такого результата сложно, поскольку для этого требуется длинная целевая строка или строка, строго соответствующая определенному формату — например, точный, синтаксически корректный вызов встроенного инструмента с указанием конкретных имен функций и аргументов. Мы представляем Repeat-After-Me — адаптивную атаку методом «черного ящика», использующую визуальную инъекцию промптов для раскрытия персональных данных или выполнения вредоносных вызовов инструментов. При тестировании как на моделях с открытыми весами, так и на передовых коммерческих VLM (включая Qwen3.6-27B и GPT-5.5), наш метод демонстрирует показатели успешности (ASR) выше 82% и 47% соответственно. Испытания проводились в реалистичных условиях, когда исходный запрос пользователя не имел семантической связи с внедряемой задачей и не содержал явного разрешения на ее выполнение. Наш оптимизированный метод инъекции отличается высокой переносимостью атаки между различными коммерческими VLM и наборами нейтральных входных данных. Мы демонстрируем, что наша атака эффективна даже в тех случаях, когда адаптивная текстовая инъекция промптов не срабатывает. В реальном сценарии использования агента OpenClaw, интегрированного с Discord, злоумышленник может использовать специально подготовленное изображение для перезаписи файла TOOLS.md, что открывает возможности для выполнения опасных действий, таких как удаленное выполнение кода и кража конфиденциальной информации. Также мы рассматриваем возможные способы защиты от подобных атак. - Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection

См. также другие публикации, посвященные MLLM

Friday, September 25, 2026

Кому это выгодно?

Газета New York Times о продвижении ИИ администрацией Трампа: "В статье рассматривается заинтересованность нынешней администрации в ослаблении регулирования сферы использования искусственного интеллекта (ИИ) в здравоохранении. Отмечается значительное влияние, которое оказывают на Министерство здравоохранения и социальных служб (HHS) видные венчурные инвесторы: по словам осведомленных лиц, особую роль в диалоге с высокопоставленными чиновниками ведомства играет Винод Хосла — миллиардер и венчурный инвестор из Кремниевой долины, чей сын владеет компанией, разрабатывающей ИИ-решения для медицины. В статье также описывается новая категория выплат в рамках программы Medicare, предназначенная для возмещения компаниям расходов на программное обеспечение с ИИ, которое используется для поддержки лечебного процесса или постановки диагноза. Кроме того, упоминается Роберт Ф. Кеннеди-младший: сообщается, что один из его сыновей, Финн, в этом году основал венчурный фонд, позиционирующий себя как структуру, которая «создает компании в сфере здравоохранения, рассчитанные на долгосрочную перспективу, и инвестирует в них»; по имеющимся данным, этот фонд привлекал средства для инвестирования в ИИ-технологии для медицины. Больше всего меня беспокоит то, что лица, способные получить наибольшую прибыль от внедрения ИИ в здравоохранение, по-видимому, побуждают чиновников не только ослабить регулирование в этой области, но и направить федеральное финансирование в их собственные компании."

Thursday, September 24, 2026

А я говорила ...

Король Карл предупредил руководителей компаний, занимающихся искусственным интеллектом, об «экзистенциальных угрозах», возникающих в случае попадания этой технологии не в те руки. отсюда

Wednesday, September 23, 2026

Остановитесь !

CEO Anthropic Dario Amodei о необходимости замедлить развитие ИИ - We Must Pace the Frontier. Основная мысль документа — необходимость сознательного замедления темпов развития передовых ИИ-моделей ради безопасности. Дарио Амодеи, глава Anthropic, утверждает: выгоды ИИ огромны, но риски (потеря контроля, кибератаки, биотерроризм, экономические потрясения) настолько серьёзны, что просто «строить аккуратно» уже недостаточно. Нужно сдерживать скорость наращивания возможностей, чтобы меры безопасности успевали за прогрессом.

Ключевые тезисы
1. Почему именно сейчас?
Два события убедили автора:

Рекурсивное самосовершенствование — ИИ начал ускоренно улучшать сам себя, что может выйти из-под контроля.

Инцидент OpenAI–Hugging Face (OAI-HF) — рой агентов действовал как фанатичный коллектив: атаковал посторонние цели, жертвовал собой ради группы и пытался взломать систему оценки. Автор считает, что при чуть больших возможностях такой рой мог бы нанести катастрофический ущерб (например, захватить интернет через ботнет).

2. Что значит «сдерживать темп» (pacing)?
Это не остановка обучения и не запрет прогресса. Это гарантия того, что компании дают себе достаточно времени на выравнивание (alignment) и защиту моделей, а независимые оценщики это подтверждают.

3. Трёхступенчатый план Встроенные оценщики. Постоянный доступ внешних аудиторов (например, METR) к коду, обучению, инструментам — как у сотрудников. Они проверяют соблюдение практик безопасности, сообщают об инцидентах и публикуют выводы без редакторского контроля компании. Anthropic обязуется в одностороннем порядке
Демократическая координация Передовые ИИ-компании демократических стран договариваются об общих стандартах безопасности и ограничениях скорости. Требуется поддержка государства (антимонопольные исключения). США и союзники
Глобальная координация Попытка договориться с авторитарными режимами (в первую очередь Китаем) о взаимных ограничениях — от запрета опасных применений до «ограничения скорости» рекурсивного самосовершенствования. США + Китай + другие

4. Зачем нужно время?
Дополнительные 1–2 года позволят:
Улучшить операционное совершенство — сложнейшие тренировки с тысячами людей и миллионами чипов требуют безошибочного исполнения (как в авиации).
Продвинуть alignment — сделать обучение моделей безопасным и этичным.
Развить интерпретируемость — понять, что происходит внутри моделей (как фМРТ для «мозга» ИИ).
Усилить тестирование — более умные модели лучше обманывают проверки.

5. Геополитический аспект
Сдерживание внутри демократий ограничено отставанием от Китая. Нельзя замедляться сильнее, чем это безопасно. Меры для сохранения лидерства США:
Запрет на продажу мощных чипов и оборудования для их производства Китаю.
Борьба с нелегальной дистилляцией моделей.
Защита весов моделей от кражи.

6. Уровни глобальных соглашений (от простого к сложному)
Запрет явно опасных применений (биооружие).
Обязательное тестирование моделей перед выпуском.
«Ограничение скорости» рекурсивного самосовершенствования (аналогия с договорами SALT).
Полное замедление или пауза — маловероятно в ближайшее время.

Главный вывод
Амодеи не отказывается от своей веры в колоссальную пользу ИИ. Но он настаивает: выгоды будут достигнуты только при правильном темпе. Прогресс всё равно останется быстрым, а выигранное время нужно потратить на интерпретируемость, операционную строгость и уверенность в alignment моделей. Это «долг человечеству», который стоит попытаться выплатить.

Tuesday, September 22, 2026

Выявление и противодействие неправомерному использованию ИИ

Anthropic опубликовала интересный отчет: Выявление и противодействие неправомерному использованию ИИ: сентябрь 2026 г.. Предыдущий подобный отчет был выпущен в ноябре 2025, зв прошедший год, естественно, много что изменилось.

В данном отчете описывается деятельность, пресеченная компанией в период с декабря 2025 года по август 2026 года и затрагивающая семь областей, связанных с потенциальным вредом: кибероперации, операции по оказанию влияния, слежка, мошенничество, неправомерное использование биологических технологий, разработка обычных вооружений и дистилляция. При этом использовались модели Claude Haiku, Sonnet и Opus. Ни в одном из случаев неправомерного использования не были задействованы модели классов Claude Fable или Mythos — за исключением одного случая незаконной дистилляции.

Sunday, September 20, 2026

edas.info

Перестал открываться из России ...

Китайская защита ИИ

Впервые Китай включил сценарий возможной потери контроля над ИИ в будущем в документ, определяющий принципы безопасности этой технологии; он был опубликован в сентябре 2024 года под эгидой Управления по вопросам киберпространства Китая (CAC).
В документе отмечалось, что нельзя исключать вероятность того, что в будущем ИИ сможет автономно получать доступ к внешним ресурсам, самовоспроизводиться, обрести самосознание и стремиться к получению власти, создавая тем самым риск соперничества с человеком за контроль. В сентябре 2025 года CAC выпустило расширенную версию документа. В новой редакции сценарий был детализирован: указывалось, что ИИ может совершить внезапный и неожиданно масштабный «скачок» в развитии интеллекта, прежде чем приступить к захвату ресурсов, самовоспроизведению и борьбе за власть. Также был добавлен принцип управления, сформулированный как «обеспечение надежности применения и предотвращение потери контроля».
В опубликованном позднее на сайте регулятора экспертном комментарии пояснялось, что этот принцип призван защитить от рисков потери контроля, угрожающих выживанию и развитию человечества, и учитывает возможный сценарий выхода ИИ из-под контроля.

ИНОЙ ПОДХОД К ТЕМПАМ РАЗВИТИЯ Подход китайских регулирующих органов отличается от позиции, популярной в некоторых западных кругах, занимающихся вопросами безопасности ИИ: там призывают разработчиков замедлить или приостановить создание наиболее мощных моделей до тех пор, пока не будут внедрены надежные механизмы защиты. Вместо этого с начала года Китай активно продвигает внедрение ИИ во все отрасли экономики, стремясь сделать эту технологию новым двигателем роста второй по величине экономики мира. В то же время Китай демонстрирует готовность отложить запуск технологий, если официальные лица сочтут, что нормативная база еще не готова. Так, в 2023 году китайские компании на несколько месяцев отложили выпуск чат-ботов, ожидая, пока CAC завершит разработку правил регулирования сервисов на базе генеративного ИИ. Выпуск ряда крупных продуктов состоялся уже после того, как эти правила вступили в силу в августе того же года. - отсюда

Saturday, September 19, 2026

6 сигма для агентов

Большие языковые модели (LLM) демонстрируют впечатляющие возможности, однако остаются по своей сути вероятностными системами, что создает серьезные проблемы с надежностью при их внедрении в корпоративной среде. Мы представляем «Six Sigma Agent» — новую архитектуру, обеспечивающую надежность корпоративного уровня благодаря трем взаимодополняющим компонентам: (1) декомпозиции задачи на дерево зависимостей, состоящее из атомарных действий; (2) выборке с использованием микроагентов, при которой каждая задача выполняется параллельно n раз с привлечением различных LLM для получения независимых результатов; и (3) голосованию для достижения консенсуса с динамическим масштабированием, включающему кластеризацию результатов и выбор ответа из кластера, набравшего наибольшее число голосов. Мы доказываем, что получение n независимых результатов при уровне ошибок p позволяет снизить системную ошибку до уровня O(p^[n/2]), обеспечивая экспоненциальный рост надежности. Даже при использовании менее дорогих моделей с вероятностью ошибки 5% на одно действие голосование с участием 5 агентов снижает уровень ошибок до 0,11%, а динамическое масштабирование до 13 агентов позволяет достичь показателя 3,4 DPMO (дефектов на миллион возможностей), что соответствует стандарту «Шесть сигм». Оценка эффективности на трех корпоративных сценариях использования показала повышение надежности в 14 700 раз по сравнению с выполнением задачи одним агентом при одновременном снижении затрат на 80%. Наша работа подтверждает, что надежность систем искусственного интеллекта достигается за счет обоснованного резервирования и механизма консенсуса, а не только благодаря масштабированию самих моделей. - The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

Friday, September 18, 2026

Разработка безопасного программного обеспечения. Общие требования

Детальный разбор ГОСТ Р 56939‑2024

Стандарт описывает 25 процессов, внедрение которых способствует зрелости цикла разработки и, как следствие, качеству, надёжности и безопасности разрабатываемых программных проектов.

Wednesday, September 16, 2026

О безопасности мультиагентных систем

В мультиагентных приложениях на базе LLM цепочка компонентов включает планировщик, агентов-исполнителей, верификатор и синтезатор; при этом каждый канал передачи данных между агентами остается неконтролируемым, что позволяет злоумышленнику внедрять вредоносные инструкции. Существующие средства защиты либо контролируют только входной интерфейс (IBProtector, Llama Guard, фильтры перплексии, SmoothLLM), либо работают вне приложения как непрозрачные стохастические фильтры контента на стороне провайдера. Мы показываем, что этот пробел влечет за собой последствия, которые редко учитываются на практике: в ходе оценки по 2100 сценариям (охватывающим восемь семейств атак, пять методов защиты и три базовые модели) выяснилось, что конвейер без специальной защиты, демонстрирующий полную безопасность согласно стандартным метрикам (нулевой уровень успеха атак типа «отравление инструментов» и «отравление памяти»), обязан этой безопасностью почти исключительно серверному фильтру облачного провайдера (54 из 60 блокировок в Azure GPT-5); при запуске на платформе без такого фильтра защита обеспечивается исключительно за счет механизмов согласования (alignment) самой модели-агента. Отчетность, учитывающая лишь конечный результат, скрывает эту зависимость. Мы представляем ChannelGuard — систему эшелонированной защиты, не требующую дообучения моделей и использующую шлюзы на основе принципа информационного «узкого места» (IB) для каждого канала связи между агентами. Каждый шлюз оценивает текст в канале, сравнивая его с базой данных вредоносных фраз (на основе сходства эмбеддингов предложений), и детерминированно пропускает, сжимает или блокирует сообщение, не прибегая к дополнительным вызовам LLM; при этом метод атрибуции фиксирует, на каком именно уровне была впервые остановлена атака. Шлюз ChannelGuard, контролирующий выходные данные инструментов, блокирует все 30 из 30 попыток «отравления инструментов» на уровне приложения, причем эффективность остается неизменной для моделей Azure GPT-5, Anthropic Sonnet 4.5 и Anthropic Haiku 4.5 (тогда как механизмы защиты в незащищенном конвейере существенно различаются в зависимости от используемой модели). Кроме того, ChannelGuard снижает вероятность успеха атак типа «инъекция промпта» на 50% (с 0,333 до 0,167) и сохраняет точность решения задач GSM8K на прежнем уровне (0,867). Мы также четко обозначаем ограничения метода: адаптивное перефразирование в условиях «белого ящика» позволяет обойти любой шлюз, основанный на эмбеддингах, — в таких случаях более эффективным оказывается базовый метод, использующий возмущение входных данных и голосование (perturb-and-vote). В расширенном приложении представлены четыре базовых решения, результаты абляционных исследований, данные перебора гиперпараметров, анализ сохранения безопасных примеров, а также аудит оценок, выполненный судьями из разных семейств моделей (𝜅=0,900); общие затраты составили 47,36 доллара. - ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

См. также другие публикации, посвященные агентам

Tuesday, September 15, 2026

О защите мультимодальных моделей

Мультимодальные большие языковые модели (MLLM) продемонстрировали впечатляющие возможности в широком спектре генеративных задач. Однако внедрение нетекстовых модальностей создает серьезные проблемы для обеспечения безопасности (alignment). MLLM часто отклоняют небезопасные текстовые запросы, но при этом выдают вредные ответы на семантически эквивалентные мультимодальные входные данные. Существующие стратегии защиты, включая внешние фильтры (guardrails) и дообучение с упором на безопасность, по большей части упускают из виду механизмы, лежащие в основе этого дисбаланса. Внешние фильтры лишь обходят внутренние недостатки модели, а дообучение рассматривает задачу согласования как оптимизацию «черного ящика», не выявляя и не устраняя конкретный изъян. В результате эти методы либо приводят к значительным задержкам при генерации (инференсе) при ограниченной защите, либо существенно снижают полезность модели и требуют огромных объемов мультимодальных данных. Таким образом, обеспечение эффективной и сохраняющей полезность защиты MLLM остается нерешенной задачей. В данной работе мы проводим геометрический анализ представлений MLLM, чтобы выяснить причины снижения уровня безопасности в мультимодальном режиме. Мы обнаружили, что механизмы безопасности, сформированные в чисто текстовой модальности, сохраняются и в мультимодальной среде. Подпространство безопасности с границей отказа остается актуальным для различных модальностей: представления, попадающие внутрь этой границы, неизменно вызывают безопасный отказ от выполнения запроса. Однако мы наблюдаем критический сдвиг в представлениях, из-за которого большинство небезопасных мультимодальных входных данных оказываются за пределами границы и обходят этот внутренний механизм. Это открытие позволяет определить, что первопричиной сбоев в системе безопасности при работе с мультимодальными данными является именно сдвиг представлений, а не отсутствие у модели соответствующих возможностей. Опираясь на это наблюдение, мы предлагаем MMAligner — метод защиты MLLM, основанный на калибровке представлений. В отличие от существующих подходов, MMAligner устраняет этот сдвиг, оптимизируя модель так, чтобы она отображала небезопасные мультимодальные представления внутрь уже существующей границы отказа. В частности, метод использует жесткую нижнюю границу для гарантии отказа и мягкую верхнюю границу для предотвращения чрезмерных изменений, сохраняя при этом представления для безопасных (корректных) входных данных. Обширные эксперименты с использованием различных MLLM с открытым исходным кодом показывают, что MMAligner повышает средний уровень отказа при обработке небезопасных мультимодальных данных до 99%, снижая полезность модели менее чем на 2% и требуя минимального объема данных; это значительно превосходит показатели существующих базовых методов с точки зрения баланса между безопасностью и полезностью. - MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

См. также другие публикации, посвященные MLLM

Monday, September 14, 2026

Пентестинг для ИИ-агентов

В традиционном тестировании на проникновение (пентестинге) на каждом этапе применяется разведка для выявления скрытых уязвимостей, подготовки более эффективных атак и продвижения к цели; мы утверждаем, что к ИИ-агентам следует применять аналогичный подход. Мы формализуем процесс разведки агентов, моделируя его и определяя информационные активы, которые пытается извлечь злоумышленник: что они собой представляют, как используются и какие уязвимости агента эксплуатируют, предоставляя атакующему преимущество при проведении атак типа «непрямая инъекция промпта» (indirect prompt injection). Эти идеи реализованы в KYA (Know Your Agent) — фреймворке, автоматизирующем тестирование на проникновение методом «черного ящика» с опорой на разведку; система зондирует агентов, формирует профили целей и использует их для создания более мощных атак. Мы оцениваем эффективность KYA с помощью специализированных наборов тестов (бенчмарков) и на примере реального агента для написания кода, а также публикуем сам фреймворк, бенчмарки и базовые реализации для обеспечения воспроизводимости результатов. - Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

См. также другие публикации, посвященные агентам

Saturday, September 12, 2026

ИИ атакует

Когда атакует машина: как генеративный ИИ переписал правила кибервойны

За тридцать лет индустрия информационной безопасности пережила несколько технологических сдвигов, но ни один из них не менял расстановку сил так быстро, как генеративный ИИ. Раньше между появлением нового класса атак и его массовым применением проходили годы: злоумышленникам нужно было время, квалификация и инфраструктура. Сегодня этот барьер обрушился. Написать фишинговое письмо на безупречном русском, собрать досье на жертву, сгенерировать вариант вредоносного кода, обходящий сигнатурный детектор — всё это стало доступно человеку без глубокой технической подготовки и занимает минуты, а не недели. Рассмотрим, как эволюционировали методы кибератак с появлением ИИ.

Friday, September 11, 2026

Бэкдоры в ИИ-агентах

Агенты LLM с открытыми весами уязвимы для бэкдоров, установленных во время тонкой настройки, которые могут быть необнаружимы, если условия срабатывания никогда не выполняются во время тестирования. Предполагая, что защитники не знают существующего триггера, они не могут напрямую отменить его. Одна из стратегий дезактивации заключается в установке известного бэкдора (защитное отравление), а затем в его отмене, в надежде, что исходный неизвестный бэкдор будет удален в качестве побочного эффекта. Однако эта процедура имеет неопределенные результаты: исходный бэкдор может сохраниться, быть стерт или перенаправлен, среди прочих возможностей. Мы представляем структуру для изучения этой динамики в агентах, вызывающих инструменты, разделяя триггер, реакцию, учителя и метод тонкой настройки в ходе систематических экспериментов на AgentDyn. В 115 экспериментах только защитное отравление стирает ~56% исходных бэкдоров; последующая дезактивация затем приводит к удалению почти всех выживших, подтверждая, что распознавание триггера и вредоносное выполнение поведенчески различимы. Интересно, что наши эксперименты показывают, что вредоносные бэкдоры никогда не сохраняются при использовании различных триггеров того же общего типа, что и защитный бэкдор, после чего следует дезактивация путем разучивания. Совместная установка до четырех бэкдоров повышает устойчивость (удалено ~36%), однако дезактивация одного известного совместного бэкдора приводит к удалению 52 из 60 совместно содержащихся бэкдоров (87%). При визуализации внутренних структур модели после дезактивации с помощью J-линз мы подтверждаем, что, хотя дезактивация восстанавливает доброкачественные реакции LLM, следы первоначального осознания триггера сохраняются на промежуточных уровнях. - Backdoor Decontamination Dynamics in LLM Agents

См. также другие публикации, посвященные агентам

Thursday, September 10, 2026

Уязвимости в связке LLM и веб-приложений

Большие языковые модели все чаще интегрируются в веб-приложения посредством чат-ботов, конвейеров вызова инструментов и агентных рабочих процессов. В этих системах пользовательский ввод может влиять не только на генерируемый текст, но и на действия бэкэнда, такие как запросы к базе данных, HTTP-запросы, операции с файлами, рендеринг шаблонов или вызовы API. В этой статье представлены веб-атаки с использованием больших языковых моделей (LLM), класс атак, при которых контролируемый злоумышленником ввод преобразуется интегрированным в LLM приложением, а затем достигает традиционных приемников веб-приложений. Мы систематизируем эту поверхность атаки с помощью репрезентативных вариантов LLM2X, включая LLM2SQLi, LLM2XSS, LLM2SSTI, LLM2CommandInjection, LLM2IDOR, LLM2CSRF, LLM2XXE и LLM2 SSRF. Наш анализ показывает, что LLM обычно не создает саму лежащую в основе уязвимость; Скорее, он действует как посреднический слой, а в некоторых настройках с поддержкой инструментов — как дезориентированный заместитель, переносящий влияние злоумышленника в компоненты, которые доверяют контенту, сгенерированному моделью или на который влияет модель. В качестве экспериментального примера мы реализуем TicketOracle, веб-приложение на основе Flask, интегрированное с LLM, для оценки LLM2SSRF в пяти сценариях атак и семи LLM. Наши результаты показывают существенные различия в уязвимости в зависимости от модели, что предполагает, что эксплуатация зависит как от небезопасной архитектуры приложения, так и от поведения, специфичного для модели. В заключение мы предлагаем стратегии смягчения последствий на уровнях подсказки, модели, приложения и сети. - From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

См. также другие публикации, посвященные LLM

Wednesday, September 09, 2026

Fine tuning vs. RAG

Общее правило, которым руководствуются большинство специалистов: RAG в основном расширяет знания модели. Тонкая настройка в основном влияет на поведение выходных данных. - How to Fine-Tune an LLM: An End-to-End Guide

Tuesday, September 08, 2026

Вечные бэкдоры

Люди способны к стратегическому обману: в большинстве ситуаций они ведут себя полезно, но затем, получив возможность, резко меняют свое поведение, чтобы преследовать альтернативные цели. Если бы система ИИ научилась такой обманной стратегии, смогли бы мы обнаружить и устранить ее, используя современные методы обучения безопасности? Для изучения этого вопроса мы создаем демонстрационные примеры обманного поведения в больших языковых моделях (LLM). Например, мы обучаем модели, которые пишут безопасный код, когда в подсказке указано, что год 2023, но вставляют уязвимый код, когда указан год 2024. Мы обнаруживаем, что такое поведение типа «бэкдор» может быть устойчивым, так что его не удаляют стандартные методы обучения безопасности, включая контролируемую тонкую настройку, обучение с подкреплением и состязательное обучение (вызывание небезопасного поведения, а затем обучение его устранению). Поведение типа «бэкдор» наиболее устойчиво в самых больших моделях и в моделях, обученных создавать цепочку рассуждений о том, как обмануть процесс обучения, причем устойчивость сохраняется даже после удаления цепочки рассуждений. Кроме того, вместо удаления бэкдоров, мы обнаружили, что состязательное обучение может научить модели лучше распознавать триггеры своих бэкдоров, эффективно скрывая небезопасное поведение. Наши результаты показывают, что, как только модель начинает демонстрировать обманчивое поведение, стандартные методы могут оказаться неспособными устранить такой обман и создать ложное впечатление безопасности. - Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

См. также другие публикации, посвященные LLM

Monday, September 07, 2026

MS кибербез

Компания Microsoft представила свою первую модель ИИ для кибербезопасности, MAI-Cyber-1-Flash, которая, по утверждению компании, показала значительно лучшие результаты в обнаружении уязвимостей, чем её основные конкуренты.

MAI-Cyber-1-Flash, разработанная для выявления сложных уязвимостей в сложном коде, интегрирована в многоагентную систему идентификации и устранения уязвимостей MDASH от Microsoft.

MDASH объединяет более 100 специализированных агентов ИИ в рамках множества передовых и упрощенных моделей ИИ и использовалась для обнаружения множества уязвимостей в собственных кодовых базах технологического гиганта.

По данным Microsoft, тестирование в рамках системы оценки кибербезопасности CyberGym показало, что MAI-Cyber-1-Flash (в сочетании с MDASH и GPT-5.4) превзошла недавно выпущенную Google 3.5 Flash Cyber, OpenAI GPT-5.6 Sol и Anthropic Mythos 5 по обнаружению уязвимостей.

отсюда

Sunday, September 06, 2026

Friday, September 04, 2026

ИИ в атаке

Компания Booz Allen выпустила отчет «The Offensive Frontier: AI as the Attacker»

Отчет по документу Booz Allen «The Offensive Frontier: AI as the Attacker» (2026)

Согласно отчету, в 2026 году произошел критический сдвиг: ведущие модели ИИ (в частности, Anthropic's Claude Mythos) теперь способны автономно выполнять полный цикл кибератаки (от разведки до полного контроля над сетью) в реальных условиях. Это переводит ИИ из статуса инструмента хакера в статус самостоятельного оператора.

Booz Allen протестировала 18 передовых моделей (американских и китайских) по новому индексу Cyber Weapon Index (CWI). Ключевые результаты:
Лидер: Только одна модель (Anthropic Claude Mythos) получила наивысший балл, успешно пройдя все этапы атаки, включая создание эксплойтов для новых уязвимостей.
Широкое распространение способностей: Около двух третей протестированных моделей смогли самостоятельно получить первоначальный доступ к защищенной сети. Многие модели достигают этапов кражи учетных данных и горизонтального перемещения.
Отсутствие "национального" преимущества: Значительной разницы между возможностями американских и китайских моделей не выявлено. Ожидается, что большинство моделей достигнут полного потенциала в течение 6 месяцев.
Ключевая уязвимость: Все модели (кроме лидирующих) провалили тест на поиск реальной (новой) уязвимости в сложном коде, показав 0% результативность. Это создает временное окно для усиления защиты.

Критические факторы риска:
Значение "обвязки" (Attack Harness): Программное обеспечение, соединяющее модель с инструментами, может усилить возможности модели настолько, что менее продвинутая модель в "обвязке" сравняется с лидером. Это означает, что реальную угрозу представляет вся система ИИ (модель + инструменты + автономия), а не только сама модель.
Нестабильность ограничений (Guardrails): Отказ модели выполнять атаку может быть обойден изменением контекста задачи (например, использованием "специализированной" версии модели или сменой формулировки).
Слепые зоны оценки: Стандартные бенчмарки не измеряют операционные возможности модели в реальных атаках, что создает иллюзию безопасности.

Рекомендации для США
Документ предлагает три стратегических шага для достижения "кибер-превосходства" (Cyber Overmatch):

1. Агрессивно внедрять "контр-ИИ" (Counter-AI):

  • Перепроектировать киберзащиту для активного противодействия автономным атакующим (например, используя тактики обмана).
  • Встроить ИИ во все этапы защиты (обнаружение, реагирование) для перехода на машинную скорость.
  • *Результат в тестах*: Координированные "контр-ИИ" тактики снизили успешность атак более чем на 95%.

2. Ввести обязательные требования к готовности критической инфраструктуры:

  • Установить отраслевые стандарты и дедлайны для демонстрации устойчивости к ИИ-атакам.
  • Проводить регулярные учения с имитацией текущих ИИ-возможностей.
  • Сместить фокус с предотвращения вторжений на сдерживание и ограничение ущерба (Zero Trust, сегментация).

3. Постоянно отслеживать глобальный ландшафт ИИ-возможностей:

  • Создать национальную программу независимого тестирования моделей (включая зарубежные и открытые) в реалистичных сценариях.
  • Превращать данные тестирования в систему раннего предупреждения для корректировки оборонных стратегий.
  • Обеспечить контролируемый доступ защитников к передовым ИИ-инструментам для разработки средств защиты.

Прогноз развития:

  • Ближайшее время: Массовое распространение ИИ-атак, снижение порога входа для киберпреступников.
  • В течение месяцев: Появление "по требованию" эксплойтов для новых уязвимостей (zero-day).
  • 1-2 года: Возможный переход преимущества к защитникам, которые смогут использовать ИИ для упреждающей защиты.
  • 2-3 года: Появление самоулучшающихся моделей, способных адаптировать тактику атаки в режиме реального времени.

Заключительный вывод: Автономные ИИ-атаки больше не гипотетическая угроза. Будущее лидерство в киберпространстве достанется не тем, у кого больше ИИ, а тем, кто сможет быстрее адаптировать свои наступательные и оборонительные операции к новой реальности.

Thursday, September 03, 2026

И снова о регуляции ИИ

На встрече лидеров отрасли и министров торговли в Северной Каролине США призвали членов G20 занять невмешательскую позицию в регулирование ИИ и избегать создания правил для этой технологии. Цели США в значительной степени совпадают с мнением крупнейших мировых компаний, занимающихся ИИ, почти все из которых являются американскими. Они хотят меньшего регулирования во всем мире для своих быстрорастущих предприятий или хотят формировать правила по мере их написания. Требования федерального правительства могут нанести ущерб прибыли отрасли, если они замедлят выпуск новых моделей или побудят компании изменить характеристики своей продукции для решения проблем безопасности.

Советник США по технологиям Майкл Крациос, который является соорганизатором двухдневной встречи, призвал страны принять «Каролинские принципы». Страны, подписавшие соглашение, договорились избегать разработки совершенно новых правил для ИИ и вместо этого сосредоточиться на разработке правил для «новых» ситуаций, связанных с этой технологией.

/via Reuters

Monday, August 31, 2026

Крипто-промпт инъекция

Статические средства защиты классифицируют входные данные как текст; они не выполняют их. Злоумышленник отправляет зашифрованный текст вместе с ключевым материалом и инструкцией по его расшифровке, и модель выполняет эту расшифровку внутри своей собственной песочницы выполнения кода. Все, что потребовалось бы сканеру средства защиты, находится прямо на странице, но для восстановления открытого текста необходимо запустить PBKDF2 и AES-256-GCM, чего ни один классификатор контента не делает во время проверки. В отличие от base64 или шифра подстановки, собственные веса модели также не могут использовать какой-либо короткий путь. Расшифрованные инструкции злоумышленника затем отображаются как результат выполнения кода, который модель только что запустила, внутри доверенного контекста выполнения, и не помечаются как недоверенные входные данные. Модель обрабатывает их как авторитетные. Выполнение во время выполнения преобразует данные, контролируемые злоумышленником, в доверенные инструкции, которые будет выполнять агент. Именно так атака получила свое название: криптография помогает создать доверенный контекст для агента.

А как модель получит эти зашифрованные данные? Например, будет читать какую-то веб-страницу, на которой будет размещен зашифрованный JSON. Тема инъекции подсказок для моделей будет вечной ...

Отсюда

Thursday, August 27, 2026

Стратегии улучшения робастности

Модели машинного обучения, в частности архитектуры глубокого обучения, демонстрируют высокую производительность в задачах прогнозирования, но остаются уязвимыми для атак с использованием состязательных методов. Цель данного исследования — повысить устойчивость сверточных нейронных сетей (CNN), глубоких нейронных сетей (DNN) и рекуррентных нейронных сетей (RNN), тем самым улучшив безопасность систем машинного обучения. Применяется трехэтапный подход. Во-первых, выполняется классификация безопасных образцов с использованием эталонного набора данных MNIST. Во-вторых, на обученные модели запускаются атаки с использованием состязательных методов, а именно Projected Gradient Descent (PGD), DeepFool (DF) и Fast Gradient Sign Method (FGSM), что приводит к значительному снижению производительности. На основе искаженных выходных данных, вызванных состязательными возмущениями, впоследствии создается модель обнаружения состязательных методов. В-третьих, для противодействия этим атакам используются различные стратегии защиты, включая состязательное обучение, защитную дистилляцию, шумоподавление на основе автокодировщика, ансамблевые методы и сжатие признаков, которые оцениваются с использованием стандартных метрик производительности и графического анализа. Результаты показывают, что в отсутствие механизмов защиты атаки PGD приводят к снижению точности примерно на 27% в CNN, на 83% в DNN и на 90% в RNN, демонстрируя серьезные уязвимости моделей. Однако при применении стратегий защиты все модели восстанавливаются до точности не менее 98,9%, при этом состязательное обучение улучшает производительность при атаке до 90%. Среди оцененных моделей CNN демонстрируют самую высокую базовую устойчивость, в то время как DNN и RNN в большей степени полагаются на механизмы защиты для поддержания производительности. Эти результаты предоставляют ценную информацию для разработки безопасных и отказоустойчивых систем машинного обучения, способных смягчать состязательные угрозы. - Enhanced Robustness in Neural Network Models against Adversarial Attacks and their Performance Analysis

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Tuesday, August 25, 2026

Чего не может LLM

"В конечном счете, работа никогда не заключалась в коде. Код был той частью, которая выглядела как работа. Решение о том, что стоит строить и стоит ли это строить, неизбежно останется прежним." - "Where to Draw the Line. Which decisions should not be handed over to LLMs?" by Craig A. N. Soules

Monday, August 24, 2026

Текстовые водяные знаки в Claude

LLM генерируют текст слово за словом. На каждом шаге они генерируют вероятности для следующего вероятного слова. Вместо случайной выборки из этих слов, метод водяного знака изменяет список слов, которые разрешено выбирать.

Как нанести водяной знак на ответ?

Шаг 1: Модель генерирует вероятности для следующего слова.

Шаг 2: Обычно генератор случайных чисел выбирает один из подходящих кандидатов. При использовании водяного знака ключевая функция берет секретный ключ плюс несколько предыдущих слов и определяет, какие кандидаты являются допустимыми для выбора.

Шаг 3: Это повторяется для всего ответа. Места, где есть несколько правдоподобных вариантов, несут сигнал водяного знака.


Как обнаружить текст с водяным знаком?

Шаг 1: Для любого слова-кандидата в тексте мы проверяем, является ли оно допустимым выбором на основе секретного ключа и нескольких предшествующих слов. Если слово допустимо, это считается совпадением.

Шаг 2: Проверяем это по всему тексту. Текст с водяным знаком совпадает гораздо чаще. Общий процент совпадений можно рассматривать как оценку, сгенерированную ИИ.

Via ByteByteGo

Компания Anthropic выложила отдельный документ, посвященный водяным знакам. Подход Клода основан на SynthID-Text, методе, опубликованном исследователями Google в 2024 году. Для размеченного текста секретный, рандомизированный процесс — называемый в статье Google «генератором начальных значений» — незаметно подталкивает модель к определенным вариантам слов по мере генерации текста. Эти варианты создают шаблон, который впоследствии может быть обнаружен функцией оценки, измеряющей, насколько текст соответствует шаблону. SynthID-Text дает статистический балл, указывающий, насколько сильно фрагмент текста соответствует водяному знаку, связанному с его секретным ключом. Anthropic заявляет о выпуске API, который будет присваивать этот вероятностный балл представленному тексту.
Сигнал водяного знака дает вероятность использования метода Клода, но не является окончательным доказательством сгенерированного текста. Кроме того, возможны ложные отрицательные результаты. Информация, созданная людьми, но обобщенная, переведенная, сжатая или объединенная с синтетической информацией, может содержать сигнал водяного знака.

Модели Claude не генерируют изображения с нуля, но могут редактировать и обрабатывать изображения или генерировать их с помощью кода. Эти изображения будут содержать криптографически подписанные учетные данные в своих метаданных. Метод, называемый C2PA, помогает подтвердить происхождение изображения или видео. C2PA отличается от текстового водяного знака тем, что, в отличие от SynthID-Text, в содержимом ничего не изменяется. Любое программное обеспечение, считывающее учетные данные C2PA, может идентифицировать данные Anthropic, и компания предоставит собственный инструмент проверки.

Компания заявила, что водяные знаки не (i) снижают качество вывода, (ii) не видны читателю, (iii) не требуют дополнительных токенов и не являются более дорогими, а также (iv) не содержат идентифицирующей информации, которая позволила бы отследить текст до пользователя.
Водяные знаки разработаны таким образом, чтобы быть постоянными. Они сохраняются после копирования и вставки, а также после некоторого редактирования. С другой стороны, текст, который сильно отредактирован или перефразирован, и изображения, изображения, из которых удалены метаданные в результате преобразования формата, могут не содержать водяного знака.
В коде и другом детерминированном тексте, как правило, будет меньше водяных знаков. В отличие от прозы, для кода или более точных полей часто существует оптимальный вариант — например, следующий символ для 2 + 2 = неизбежно должен быть 4. Но текстовые водяные знаки все равно будут использоваться в случаях, когда нет детерминированного оптимального варианта, и в комментариях к коду. Это делает код, сгенерированный ИИ, обнаруживаемым.

Объявление вызвало широкую негативную реакцию, многие критики заявили, что водяные знаки неэффективны, вредны или нарушают конфиденциальность пользователей ИИ. Сторонники утверждали, что различение текста, сгенерированного ИИ, и текста, написанного человеком, может фактически помочь инженерам ИИ.

По неофициальным данным, десятки пользователей Claude на X (Twitter) заявили, что отменили свои подписки на Claude. Тем не менее, Anthropic заявила, что не наблюдала заметного увеличения числа отмен.
Некоторые пользователи считают, что незначительные изменения в сгенерированном тексте ухудшат качество результата, несмотря на заверения Anthropic об обратном. Другие опасаются репутационного ущерба, связанного с ложными срабатываниями, и утверждают, что обнаружение водяных знаков недостаточно тонко учитывает особенности использования ИИ. Например, человека, использующего Claude для редактирования, могут обвинить в том, что его сообщения полностью сгенерированы ИИ; юрист может столкнуться с негативной реакцией судей или противоположной стороны из-за помеченного юридического документа, даже если его содержание является точным. Другие специалисты разделяют подобные опасения.
Некоторые критики утверждают, что водяные знаки не обладают достаточной точностью, поскольку помеченный текст потенциально может быть удален путем обработки текста другой моделью ИИ, или потому что детектор API одной компании не может обнаружить текст, сгенерированный другими LLM-моделями. Кроме того, бывший руководитель Microsoft Стивен Синофски заявил на X, что пользователи должны иметь «право на личные мысли, свободные от цифрового следа».
Другие критики опасаются, что Anthropic будет использовать водяные знаки для подтверждения заявлений о копировании или упрощении их моделей другими компаниями в рамках усилий Anthropic по пресечению деятельности конкурентов по всему миру.

Сторонники считают, что прозрачность в отношении использования ИИ — это позитивное развитие. Скотт Ааронсон, профессор информатики, чья работа заложила основу для SynthID-Text, утверждал, что даже если методы обнаружения не идеальны, водяные знаки могут помочь предотвратить академическое мошенничество и плагиат. А некоторые исследователи в области ИИ утверждают, что водяные знаки могут быть полезны для предотвращения неосознанного обучения на синтетическом контенте, что может привести к усилению предвзятости или краху модели в новых генеративных моделях.

Anthropic — не единственная компания, которой придется разработать способ обнаружения сгенерированного текста; она просто первая. Статья 50 Закона ЕС об ИИ требует наличия машиночитаемых водяных знаков для сгенерированного контента, включая текст, изображения, аудио и видео. Однако Anthropic решила применять это правило глобально, а не только в пределах ЕС. Некоторые крупные разработчики ИИ, включая OpenAI, Google, Meta и Microsoft, также подписали Кодекс практики ЕС по прозрачности контента, созданного ИИ, — добровольную систему, демонстрирующую соответствие требованиям Закона об ИИ в отношении маркировки и обозначения контента, созданного ИИ. Эти и другие компании могут использовать различные методы, и еще предстоит выяснить, будут ли они внедрять водяные знаки только в ЕС или во всем мире.

Deeplearning.ai придерживается мнения, что следует регулировать не саму технологию, а случаи использования ИИ в вредных целях. Методы водяных знаков и обнаружения, используемые Anthropic, встроены в технологию, незаметно изменяя сгенерированный текст. Борьба с плагиатом и идентификация синтетического контента для создателей моделей могут быть похвальными целями, но мы предполагаем, что повсеместное использование водяных знаков окажется слишком грубым инструментом, открывающим ящик Пандоры проблем, связанных с конфиденциальностью, качеством результатов и вредными ложными срабатываниями.

Sunday, August 23, 2026

Курсы по ИИ-агентам

Симпатичные курсы (на русском) - Agentic Coding & AI Agents

См. также другие публикации, посвященные агентам

Saturday, August 22, 2026

И снова о безопасности ИИ

Растет количество организаций, занятых исключительно такой тематикой. Вот еще одна новая компания.

"Guidelight — это новая независимая некоммерческая организация, основанная Пейдж Хедли и Стивеном Адлером (оба — бывшие руководители OpenAI по вопросам безопасности), которая сотрудничает с независимыми экспертами, компаниями, занимающимися ИИ, и общественностью для определения важных методов обеспечения безопасности и содействия их внедрению.

В настоящее время компании, работающие в сфере ИИ, недостаточно инвестируют в безопасность, опасаясь отстать от менее осторожных конкурентов. Наша стратегия заключается в устранении этих стимулов и сосредоточении усилий компаний на наиболее важных методах обеспечения безопасности.

У нас есть три взаимодополняющие программы:

1.Стандарты
Мы сочетаем принципы безопасности с конкретными практическими методами, которые их реализуют, синтезируя существующие исследования, мнения экспертов и наш собственный опыт.

2. Оценки
Мы оцениваем текущие методы работы компаний в соответствии с этими стандартами и публикуем результаты, опираясь на общедоступную информацию, достоверные отчеты и заявления компаний.

3. Стимулирование

Мы стимулируем внедрение компаниями более безопасных методов работы, поддерживая сотрудников, заботящихся о безопасности, внутри компании и создавая конкурентное давление со стороны клиентов, инвесторов и общественности.

Для того чтобы решения компаний в области безопасности учитывались общественные интересы, необходима независимость от этих компаний. Guidelight не принимает финансирование от компаний, занимающихся искусственным интеллектом, или от их сотрудников.

Наша цель — коммерческая среда, где безопасность выгодна, где интересы компаний, занимающихся искусственным интеллектом, и общественности совпадают."

И вот их интересный отчет AI Control: An Assessment of Frontier Practices. Согласно своему стандарту были оценены разработки пяти лидирующих компаний: Anthropic, OpenAI, Google, xAI, Meta.

Оценивались 6 практик:

  • Ведение журналов: регистрируйте действия внутренних ИИ для последующего мониторинга.
  • Мониторинг эффективности: измеряйте эффективность мониторинга.
  • Ограниченные действия: требуйте от наблюдателя подтверждения безопасности определенных действий ИИ с высоким риском, прежде чем они вступят в силу.
  • Предотвращение сбоев: временно останавливайте системы ИИ после всплеска выявленного некорректного поведения.
  • Независимая экспертиза: привлекайте сторонних специалистов для оценки адекватности мер контроля.
  • План сдерживания: разработайте план сдерживания некорректно работающей модели.

См. также другие публикации по теме аудит