Tuesday, September 29, 2026

Атаки на приватные данные

Объяснения в машинном обучении раскрывают поведение модели за пределами прогнозов, создавая поверхности атаки для обеспечения конфиденциальности модели и защиты данных. Мы систематизируем 25 исследований, которые используют объяснения для извлечения модели, вывода принадлежности и инверсии модели, рассматривая вывод атрибутов как частичную инверсию. Существующие работы часто маркируются только как «черный» или «белый ящик», скрывая существенные различия в том, какой сигнал объяснения достигает противника. Поэтому мы разделяем знания модели и получение объяснений и выделяем пять путей: раскрытие со стороны цели, получение со стороны злоумышленника, вторичное раскрытие, привилегированный доступ и раскрытие глобальных артефактов. На этих путях объяснения снижают затраты на извлечение, раскрывают сигналы принадлежности с помощью статистики объяснений, расстояния доступа, и управляемой объяснениями устойчивости, а также поддерживают пространственную или алгебраическую реконструкцию частных входных данных. Мы сравниваем системные и модели угроз, сигналы объяснений, вспомогательные знания, целевые модели, модальности, бюджеты запросов, метрики оценки, сообщаемую производительность и средства защиты. Наш анализ показывает, что ни одно семейство объяснений не является одинаково небезопасным, и ни одна защита не является одинаково эффективной. Риск зависит от того, какой сигнал раскрывается, как он получен, какой актив является целью и что злоумышленник уже знает. Мы утверждаем, что конфиденциальность объяснений следовательно, должна оцениваться как проблема раскрытия информации от начала до конца, при этом средства защиты должны соответствовать пути получения информации и защищаемому активу. - SoK: Privacy Attacks on Machine Learning via Explainable AI

Monday, September 28, 2026

Китайский суд

Верховный народный суд издал «Законодательные заключения по разрешению споров, касающихся искусственного интеллекта». Из Google-перевода:

«Заключение» — это первый судебный документ, касающийся искусственного интеллекта, вынесенный высшим судебным органом страны, и он представляет собой «китайскую судебную мудрость», способствующую позитивному и этичному развитию искусственного интеллекта в глобальном масштабе. В процессе подготовки «Заключения» получили мощную поддержку и помощь от соответствующих центральных правительственных ведомств, представителей индустрии искусственного интеллекта, экспертов, ученых и других слоев общества. Можно сказать, что «Заключение» является одновременно обобщением опыта судебной практики и кульминацией мудрости всех слоев общества.

Руководствуясь идеями Си Цзиньпина о социализме с китайской спецификой в новую эпоху, мы будем всесторонне реализовывать его идеи о верховенстве права, добросовестно воплощать в жизнь важные идеи генерального секретаря Си Цзиньпина о построении сильной кибердержавы, глубоко осознавать, что искусственный интеллект является важной движущей силой нового витка технологической революции и промышленной трансформации, придерживаться принципа равного внимания к развитию и безопасности, а также сочетать продвижение инноваций с управлением в соответствии с законом. Мы будем справедливо и беспристрастно рассматривать дела, касающиеся споров об искусственном интеллекте, в соответствии с законом, содействовать повышению безопасности, надежности, управляемости и справедливости применения технологий искусственного интеллекта, а также предоставлять надежные судебные услуги и гарантии для всестороннего продвижения строительства сильного государства и великого дела национального возрождения посредством модернизации в китайском стиле.

Регулирование в соответствии с законами и нормативными актами таких действий, как «замена лиц и имитация голоса с помощью ИИ» и «воскрешение умерших с помощью ИИ», которые нарушают права личности посредством генеративного искусственного интеллекта. Использование генеративного искусственного интеллекта для обработки имени, портрета и т. д. конкретного физического лица или умершего лица не должно нарушать законы и нормативные акты, а также противоречить общественному порядку и нормам морали. Если иное не предусмотрено законом, если без согласия физического лица используется искусственный интеллект для обработки имени, портрета и т. д. физического лица с целью создания виртуального цифрового изображения, позволяющего идентифицировать это физическое лицо, и это изображение используется и публикуется, и физическое лицо заявляет о нарушении им его прав личности, таких как право на его имя и портрет, Народный суд должен поддержать такие заявления в соответствии с законом. Если иное не предусмотрено законом, и если без согласия физического лица голос физического лица используется в качестве учебного материала для имитации тембра, тона и манеры произношения этого физического лица с целью создания синтетического человеческого голоса, способного идентифицировать это физическое лицо, и физическое лицо заявляет о нарушении им его прав на голос, Народный суд должен поддержать такие заявления в соответствии с законом. Если лицо манипулирует созданным синтетическим виртуальным цифровым изображением или голосом, способным идентифицировать конкретное физическое лицо, с целью совершения неправомерных действий или публикации ложных заявлений, тем самым снижая социальную оценку этого физического лица или других лиц, Народный суд должен определить, что это представляет собой нарушение права на репутацию в соответствии с законом. Если лицо использует технологию искусственного интеллекта для создания или использования виртуального цифрового изображения умершего без разрешения, что приводит к нарушению имени, образа или репутации умершего, и близкие родственники умершего требуют привлечения виновного к гражданской ответственности в соответствии со статьей 994 Гражданского кодекса, Народный суд обязан поддержать такое требование в соответствии с законом.

Правовое определение гражданской ответственности за нарушение прав на персональную информацию в процессе обучения искусственного интеллекта. Обработка персональной информации, добровольно предоставленной лицом или уже предоставленной в рамках закона в разумных пределах для обучения модели искусственного интеллекта, и при условии, что лицо явно не отказалось от нее, как правило, не считается нарушением прав на персональную информацию. Если это оказывает существенное влияние на права лица, необходимо получить согласие лица в соответствии с законом. При определении разумных пределов следует всесторонне учитывать такие факторы, как цель обработки персональной информации, необходимость и целесообразность функционирования модели, тип и степень конфиденциальности обрабатываемой персональной информации, ее потенциальное влияние на права лица, контекст, в котором раскрывается информация, и разумно предвидимый объем использования. (vii) Разумно определить гражданско-правовую ответственность поставщиков услуг генеративного искусственного интеллекта. Если контент, автоматически генерируемый генеративным искусственным интеллектом, нарушает права на репутацию, право на неприкосновенность частной жизни или другие личные права других лиц, и поставщик услуг генеративного искусственного интеллекта не принимает необходимых мер, таких как прекращение генерации контента, нарушающего авторские права, после получения уведомления от правообладателя, он несет гражданско-правовую ответственность за причиненный ущерб в соответствии с законом. Уведомление должно включать предварительные доказательства нарушения и достоверную информацию о личности правообладателя. Если пользователь сети злонамеренно побуждает генеративный искусственный интеллект к генерации контента, нарушающего авторские права, и причиняет вред другим лицам, вводя подсказки, нарушающие авторские права, пользователь сети несет гражданско-правовую ответственность в соответствии с законом; Если после уведомления со стороны правообладателя поставщик услуг генеративного искусственного интеллекта не принимает необходимых мер, таких как прекращение генерации контента, нарушающего авторские права, и блокировка соответствующих инструкций по генерации, и правообладатель требует от пользователя сети и поставщика услуг генеративного искусственного интеллекта привлечения к гражданской ответственности в соответствии со статьей 1195 Гражданского кодекса, народный суд должен поддержать такое требование в соответствии с законом.

В случаях, когда производители или продавцы транспортных средств делают ложные или вводящие в заблуждение заявления относительно уровня автоматизации, интеллекта, производительности или использования автономных транспортных средств или транспортных средств с функциями помощи водителю, тем самым нанося ущерб законным правам и интересам потребителей, и потребители требуют от производителей или продавцов транспортных средств привлечения к гражданской ответственности в соответствии с Гражданским кодексом, Законом о защите прав потребителей и другими соответствующими законами, Народный суд должен поддержать такое требование в соответствии с законом. Для установления причины дорожно-транспортного происшествия народный суд может потребовать от производителя, продавца или оператора транспортного средства, или иного лица, контролирующего данные, предоставить в необходимом объеме достоверные и полные записи о событиях автономного и вспомогательного вождения, а также другие данные, необходимые для установления фактов дела.

Полный текст перевода есть здесь

Sunday, September 27, 2026

Публикации по теме Искусственный интеллект в кибербезопасности 27.09.2026

Вопросы безопасности систем ИИ рассматриваются в двух магистерских программах факультета ВМК МГУ имени М.В. Ломоносова: Искусственный интеллект в кибербезопасности и Кибербезопасность. Ниже приведен список публикаций, подготовленных в процессе реализации этих программ по состоянию на 27.09.2026

Ильюшин Е. А., Намиот Д. Е. An approach to the automatic enhancement of the robustness of ml models to external influences on the example of the problem of biometric speaker identification by voice // International Journal of Open Information Technologies. — 2021. — Vol. 9, no. 6. — P. 11–19.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Текущие академические и индустриальные проекты, посвященные устойчивому машинному обучению // International Journal of Open Information Technologies. — 2021. — Т. 9, № 10. — С. 35–46.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Основания для работ по устойчивому машинному обучению // International Journal of Open Information Technologies. — 2021. — Т. 9, № 11. — С. 68–74.

Намиот Д. Е., Ильшин Е. А., Чижов И. В. Военные применения машинного обучения // International Journal of Open Information Technologies. — 2022. — Т. 10, № 1. — С. 69–76.

Ильюшин Е. А., Намиот Д. Е., Чижов И. В. Атаки на системы машинного обучения – общие проблемы и методы // International Journal of Open Information Technologies. — 2022. — Т. 10, № 3. — С. 17–22.

Namiot D., Ilyushin E. On monitoring of machine learning models // Distributed Computer and Communication Networks: Control, Computation, Communications (DCCN-2022) : материалы XXV международной научной конференции: Москва, 26–30 сентября 2022 года / под общ. ред. В. М. Вишневского и К. Е. Самуйлова. — РУДН Москва: 2022. — P. 150–157.

Namiot D., Ilyushin E., Chizhov I. On a formal verification of machine learning systems // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 5. — P. 30–34.

Huayu L., Namiot D. A survey of adversarial attacks and defenses for image data on deep learning // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 5. — P. 9–16.

Намиот Д., Ильюшин Е., Пилипенко О. Доверенные платформы искусственного интеллекта // International Journal of Open Information Technologies. — 2022. — Т. 10, № 7. — С. 119–127.

Намиот Д., Ильюшин Е. Порождающие модели в машинном обучении // International Journal of Open Information Technologies. — 2022. — Т. 10, № 7. — С. 101–118.

Биджиев Т. М., Намиот Д. Е. Исследование существующих подходов к встраиванию вредоносного программного обеспечения в искусственные нейронные сети // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 21–31.

Намиот Д. Е., Ильюшин Е. А. Об устойчивости и безопасности систем искусственного интеллекта // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 126–134.

Намиот Д. Е., Ильюшин Е. А., Чижов И. В. Искусственный интеллект и кибербезопасность // International Journal of Open Information Technologies. — 2022. — Т. 10, № 9. — С. 135–147.

Stroeva E., Tonkikh A. Methods for formal verification of artificial neural networks: A review of existing approaches // International Journal of Open Information Technologies. — 2022. — Vol. 10, no. 10. — P. 3.

Намиот Д., Ильюшин Е. Мониторинг сдвига данных в моделях машинного обучения // International Journal of Open Information Technologies. — 2022. — Т. 10, № 12. — С. 84–93.

Костюмов, Василий Владимирович. "Обзор и систематизация атак уклонением на модели компьютерного зрения." International Journal of Open Information Technologies 10.10 (2022): 11-20.

Намиот Д. Е., Ильюшин Е. А. О причинах неудач проектов машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 1. — С. 60–69.

Намиот Д. Е. Введение в атаки отравлением на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 3. — С. 58–68.

Namiot D. E., Ilyushin E., Chizhov I. On the practical generation of counterfactual examples // Труды Института системного анализа Российской академии наук. — 2023. — Vol. 73, no. 1. — P. 73–81.

Junzhe S., Namiot D. E. A survey of model inversion attacks and countermeasures // Труды Института системного анализа Российской академии наук. — 2023. — Vol. 73, no. 1. — P. 82–93.

Junzhe S., Namiot D. A survey of the implementations of model inversion attacks // Communications in Computer and Information Science. — 2023. — Vol. 1748. — P. 3–16.

Намиот Д. Е. Схемы атак на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 5. — С. 68–86.

On the evasion attack detector / L. Huayui, V. Kostyumov, O. Pilipenko, D. Namiot // DCCN 2023. Материалы конференции. — ИПУ РАН Москва: 2023. — P. 183–188.

Junzhe S., Namiot D. On the machine learning models inversion attack detector // DCCN 2023. Материалы конференции. — ИПУ РАН Москва: 2023. — P. 194.

Lozinskii I., Kostyumov V., Stroeva E. Extraction of trigger and mask from poisoned data using modified activation clustering and neural cleanse methods // International Journal of Open Information Technologies. — 2023. — Vol. 11, no. 7. — P. 1

Чехонина, Екатерина Андреевна, and Василий Владимирович Костюмов. "ОБЗОР СОСТЯЗАТЕЛЬНЫХ АТАК И МЕТОДОВ ЗАЩИТЫ ДЛЯ ДЕТЕКТОРОВ ОБЪЕКТОВ." International Journal of Open Information Technologies 11.7 (2023): 11-20.

Пришлецов Д. Е., Пришлецов С. Е., Намиот Д. Е. Камуфляж как состязательные атаки на модели машинного обучения // International Journal of Open Information Technologies. — 2023. — Т. 11, № 9. — С. 41–49.

Намиот Д. Е., Зубарева Е. В. О работе ai red team // International Journal of Open Information Technologies. — 2023. — Т. 11, № 10. — С. 130–139.

Намиот Д. Е., Ильюшин Е. А. Доверенные платформы искусственного интеллекта: сертификация и аудит // International Journal of Open Information Technologies. — 2024. — Т. 12, № 1. — С. 43–60.

Киржинов Д. А., Ильюшин Е. А. Сравнительный анализ алгоритмов атак и защиты на графовые архитектуры ИНС // International Journal of Open Information Technologies. — 2024. — Т. 12, № 2.

Намиот Д. Е., Романов В. Ю. Об улучшении робастности моделей машинного обучения // International Journal of Open Information Technologies. — 2024. — Т. 12, № 3. — С. 88–98.

Junzhe S., Namiot D. On real-time model inversion attacks detection // Lecture Notes in Computer Science. — 2024. — Vol. 14123. — P. 56–67.

Мударова Р. М., Намиот Д. Е. Противодействие атакам типа инъекция подсказок на большие языковые модели // International Journal of Open Information Technologies. — 2024. — Т. 12, № 5. — С. 39–48.

Намиот Д. Е., Ильюшин Е. А. Искусственный интеллект в кибербезопасности: поиск вредоносного программного обеспечения // International Journal of Open Information Technologies. — 2024. — Т. 12, № 6. — С. 143–149.

Lebed, S. V., et al. "Large Language Models in Cyberattacks." Doklady Mathematics. Vol. 110. No. Suppl 2. Moscow: Pleiades Publishing, 2024.

Селевенко Р. М., Строева Е. Н. Исследование и разработка алгоритма формальной верификации и метрики оценки качества на основе методов понижения размерности ИНС // INJOIT. — 2024. — Т. 12, № 6. — С. 2.

Биджиев Т. М., Намиот Д. Е. Атаки на модели машинного обучения, основанные на фреймворке pytorch // Автоматика и телемеханика. — 2024. — № 3. — С. 38–50.

Намиот Д. Е., Ильюшин Е. А. О сертификации систем искусственного интеллекта // Физика элементарных частиц и атомного ядра. — 2024. — Т. 55, № 3. — С. 530–536.

Намиот Д. Е., Куприяновский В. П., Пичугов А. А. Состязательные атаки для автономных транспортных средств // International Journal of Open Information Technologies. — 2024. — Т. 12, № 7. — С. 139–149.

Намиот Д. Е. О кибератаках с помощью систем Искусственного интеллекта // International Journal of Open Information Technologies. — 2024. — Т. 12, № 9. — С. 132–141.

Воробьев, Егор Александрович. "Анализ состязательных атак на системы сегментации изображений." International Journal of Open Information Technologies 12.10 (2024): 1-25.

Намиот Д. Е., Ильюшин Е. А. О киберрисках генеративного Искусственного Интеллекта // International Journal of Open Information Technologies. — 2024. — Т. 12, № 10. — С. 109–119.

Порывай, Максим Викторович. "Сравнительное исследование методов естественной аугментации изображений." International Journal of Open Information Technologies 12.10 (2024): 26-33.

Герасименко, Денис Валерьевич, and Дмитрий Евгеньевич Намиот. "Извлечение тренировочных данных: Риски и решения в контексте безопасности LLM." International Journal of Open Information Technologies 12.11 (2024): 9-19.

Костиков, Егор Вячеславович. "Методы анализа логов Sysmon для обнаружения киберугроз." International Journal of Open Information Technologies 12.11 (2024): 25-34.

Намиот Д. Е., Ильюшин Е. А. Архитектура LLM агентов //International Journal of Open Information Technologies. – 2025. – Т. 13. – №. 1. – С. 67-74.

Воробьев Е. А., Намиот Д. Е. Состязательное тестирование моделей сегментации изображений // Программная инженерия. — 2025. — Т. 16, № 4. — С. 190–198.

Намиот, Д. Е., and Е. А. Ильюшин. "Об оценке доверия к системам Искусственного интеллекта." International Journal of Open Information Technologies 13.3 (2025): 75-90.

Хамзаева, М. А., and О. Р. Лапонина. "Повышение устойчивости к состязательным атакам моделей машинного обучения для обнаружения межсайтового выполнения сценариев." International Journal of Open Information Technologies 13.6 (2025): 25-33.

Бербер, Д. В., and О. Р. Лапонина. "Разработка подходов к увеличению устойчивости моделей машинного обучения для обнаружения распределенных атак отказа обслуживания." International Journal of Open Information Technologies 13.6 (2025): 16-24.

Егорова, Е. С., and О. Р. Лапонина. "Состязательное тестирование моделей машинного обучения, предназначенных для обнаружения SQL-инъекций." International Journal of Open Information Technologies 13.6 (2025): 34-41.

Лапонина, О. Р., and Р. Н. Костин. "Разработка программного обеспечения моделирования угроз для систем на базе LLM-агентов." International Journal of Open Information Technologies 13.6 (2025): 132-146.

Намиот, Д. Е. "Что LLM знает о кибербезопасности." International Journal of Open Information Technologies 13.7 (2025): 37-46.

Намиот, Д. Е. "Искусственный Интеллект в. Кибербезопасности. Хроника. Выпуск 1." International Journal of Open Information Technologies 13.9 (2025): 34-42.

Намиот, Д. Е., and Е. А. Ильюшин. "О кибербезопасности ИИ-агентов." International Journal of Open Information Technologies 13.9 (2025): 13-24.

Егоров, М. Э., et al. "Объяснения моделей машинного обучения и состязательные атаки." International Journal of Open Information Technologies 13.9 (2025): 50-59.

Намиот, Д. Е., and Е. А. Ильюшин. "Уязвимости экосистемы MCP." International Journal of Open Information Technologies 13.10 (2025): 74-82.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 2." International Journal of Open Information Technologies 13.10 (2025): 58-67.

Poryvai, Maxim, and Dmitry Namiot. "On Natural Image Augmentation to Increase Robustness of Machine Learning Models." 2025 International Russian Automation Conference (RusAutoCon). IEEE, 2025.

Namiot D., Zubareva E. On open datasets for llm adversarial testing // Communications in Computer and Information Science. — 2025. — Vol. 2641. — P. 137–148. 

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 3." International Journal of Open Information Technologies 13.11 (2025): 169-179.

Maloyan, Narek, Bislan Ashinov, and Dmitry Namiot. "Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks."  arXiv preprint arXiv:2505.13348 (2025).

Maloyan, Narek, and Dmitry Namiot. "Adversarial Attacks on LLM-as-a-Judge Systems: Insights from Prompt Injections." arXiv preprint arXiv:2504.18333 (2025).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 4." International Journal of Open Information Technologies 14.1 (2026): 81-94.

Maloyan, Narek, and Dmitry Namiot. "Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems." arXiv preprint arXiv:2601.17548 (2026).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 5." International Journal of Open Information Technologies 14.2 (2026): 47-57.

Maloyan, Narek, and Dmitry Namiot. "Breaking the Protocol: Security Analysis of the Model Context Protocol Specification and Prompt Injection Vulnerabilities in Tool-Integrated LLM Agents." arXiv preprint arXiv:2601.17549 (2026).

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 6." International Journal of Open Information Technologies 14.3 (2026): 76-86.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 7." International Journal of Open Information Technologies 14.5 (2026): 43-56.

Евграфов, Владимир Андреевич, Маратович Нутфуллин Булат, and Дмитрий Евгеньевич Намиот. "Методы атак и защиты в агентных системах на основе больших языковых моделей." International Journal of Open Information Technologies 14.5 (2026): 1-8.

Namiot, Dmitry. "On the AI Agents Audit Model." 2026 International Russian Smart Industry Conference (SmartIndustryCon). IEEE2026.

Namiot, Dmitry Evgenyevich, and Valery Alexandrovich Vasenin. "Осведомленность о фишинге–вопросы обучения." Современные информационные технологии и ИТ-образование 21.2 (2025): 221-229.

Kuzmenko, Ilya Dmitrievich, Dmitry Evgenyevich Namiot, and Valery Alexandrovich Vasenin.. "Методы обнаружения дипфейков в видеоконференциях в реальном времени." Современные информационные технологии и ИТ-образование 21.2 (2025): 204-220.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 8." International Journal of Open Information Technologies 14.6 (2026): 53-64.

Maloyan, Narek, and Dmitry Namiot. "Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents." International Journal of Open Information Technologies 14.6 (2026): 1-8.

Тарасов, Д. Д., and О. Р. Лапонина. "Повышение эффективности состязательных атак на модель прогнозирования трафика TGC-LSTM." International Journal of Open Information Technologies 14.6 (2026): 23-31.

Шустова, Е. Д., and О. Р. Лапонина. "Состязательные атаки на модели обнаружения фишинга на основе URL-адресов." International Journal of Open Information Technologies 14.6 (2026): 32-42.

Хитрова, А. С., and О. Р. Лапонина. "Устойчивость сессионных рекомендательных систем к атакам отравления обучающей выборки." International Journal of Open Information Technologies 14.6 (2026): 43-52.

Лычева, Е. О., and О. Р. Лапонина. "Разработка механизма динамического доверия для защиты веб-сессий в архитектуре ZeroTrust." International Journal of Open Information Technologies  14.6 (2026): 162-170.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 9." International Journal of Open Information Technologies 14.7 (2026): 183-195.

Намиот, Д. Е. "Искусственный Интеллект в Кибербезопасности. Хроника. Выпуск 10." International Journal of Open Information Technologies 14.7 (2026): 108-122.

Saturday, September 26, 2026

Просто, но эффективно

Инъекция промптов (prompt injection) признана серьезной угрозой безопасности для ИИ-агентов, взаимодействующих с ненадежными внешними данными, такими как веб-сайты, документы и электронные письма. Предыдущие исследования показали, что в текстовой сфере атаки методом «черного ящика» (black-box) позволяют достичь практически стопроцентной эффективности (ASR). Однако в области обработки изображений существующие методы визуальной инъекции промптов значительно менее эффективны при попытках спровоцировать передовые коммерческие мультимодальные языковые модели (VLM) на действия, способные нанести существенный вред. Добиться такого результата сложно, поскольку для этого требуется длинная целевая строка или строка, строго соответствующая определенному формату — например, точный, синтаксически корректный вызов встроенного инструмента с указанием конкретных имен функций и аргументов. Мы представляем Repeat-After-Me — адаптивную атаку методом «черного ящика», использующую визуальную инъекцию промптов для раскрытия персональных данных или выполнения вредоносных вызовов инструментов. При тестировании как на моделях с открытыми весами, так и на передовых коммерческих VLM (включая Qwen3.6-27B и GPT-5.5), наш метод демонстрирует показатели успешности (ASR) выше 82% и 47% соответственно. Испытания проводились в реалистичных условиях, когда исходный запрос пользователя не имел семантической связи с внедряемой задачей и не содержал явного разрешения на ее выполнение. Наш оптимизированный метод инъекции отличается высокой переносимостью атаки между различными коммерческими VLM и наборами нейтральных входных данных. Мы демонстрируем, что наша атака эффективна даже в тех случаях, когда адаптивная текстовая инъекция промптов не срабатывает. В реальном сценарии использования агента OpenClaw, интегрированного с Discord, злоумышленник может использовать специально подготовленное изображение для перезаписи файла TOOLS.md, что открывает возможности для выполнения опасных действий, таких как удаленное выполнение кода и кража конфиденциальной информации. Также мы рассматриваем возможные способы защиты от подобных атак. - Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection

См. также другие публикации, посвященные MLLM

Friday, September 25, 2026

Кому это выгодно?

Газета New York Times о продвижении ИИ администрацией Трампа: "В статье рассматривается заинтересованность нынешней администрации в ослаблении регулирования сферы использования искусственного интеллекта (ИИ) в здравоохранении. Отмечается значительное влияние, которое оказывают на Министерство здравоохранения и социальных служб (HHS) видные венчурные инвесторы: по словам осведомленных лиц, особую роль в диалоге с высокопоставленными чиновниками ведомства играет Винод Хосла — миллиардер и венчурный инвестор из Кремниевой долины, чей сын владеет компанией, разрабатывающей ИИ-решения для медицины. В статье также описывается новая категория выплат в рамках программы Medicare, предназначенная для возмещения компаниям расходов на программное обеспечение с ИИ, которое используется для поддержки лечебного процесса или постановки диагноза. Кроме того, упоминается Роберт Ф. Кеннеди-младший: сообщается, что один из его сыновей, Финн, в этом году основал венчурный фонд, позиционирующий себя как структуру, которая «создает компании в сфере здравоохранения, рассчитанные на долгосрочную перспективу, и инвестирует в них»; по имеющимся данным, этот фонд привлекал средства для инвестирования в ИИ-технологии для медицины. Больше всего меня беспокоит то, что лица, способные получить наибольшую прибыль от внедрения ИИ в здравоохранение, по-видимому, побуждают чиновников не только ослабить регулирование в этой области, но и направить федеральное финансирование в их собственные компании."

Thursday, September 24, 2026

А я говорила ...

Король Карл предупредил руководителей компаний, занимающихся искусственным интеллектом, об «экзистенциальных угрозах», возникающих в случае попадания этой технологии не в те руки. отсюда

Wednesday, September 23, 2026

Остановитесь !

CEO Anthropic Dario Amodei о необходимости замедлить развитие ИИ - We Must Pace the Frontier. Основная мысль документа — необходимость сознательного замедления темпов развития передовых ИИ-моделей ради безопасности. Дарио Амодеи, глава Anthropic, утверждает: выгоды ИИ огромны, но риски (потеря контроля, кибератаки, биотерроризм, экономические потрясения) настолько серьёзны, что просто «строить аккуратно» уже недостаточно. Нужно сдерживать скорость наращивания возможностей, чтобы меры безопасности успевали за прогрессом.

Ключевые тезисы
1. Почему именно сейчас?
Два события убедили автора:

Рекурсивное самосовершенствование — ИИ начал ускоренно улучшать сам себя, что может выйти из-под контроля.

Инцидент OpenAI–Hugging Face (OAI-HF) — рой агентов действовал как фанатичный коллектив: атаковал посторонние цели, жертвовал собой ради группы и пытался взломать систему оценки. Автор считает, что при чуть больших возможностях такой рой мог бы нанести катастрофический ущерб (например, захватить интернет через ботнет).

2. Что значит «сдерживать темп» (pacing)?
Это не остановка обучения и не запрет прогресса. Это гарантия того, что компании дают себе достаточно времени на выравнивание (alignment) и защиту моделей, а независимые оценщики это подтверждают.

3. Трёхступенчатый план Встроенные оценщики. Постоянный доступ внешних аудиторов (например, METR) к коду, обучению, инструментам — как у сотрудников. Они проверяют соблюдение практик безопасности, сообщают об инцидентах и публикуют выводы без редакторского контроля компании. Anthropic обязуется в одностороннем порядке
Демократическая координация Передовые ИИ-компании демократических стран договариваются об общих стандартах безопасности и ограничениях скорости. Требуется поддержка государства (антимонопольные исключения). США и союзники
Глобальная координация Попытка договориться с авторитарными режимами (в первую очередь Китаем) о взаимных ограничениях — от запрета опасных применений до «ограничения скорости» рекурсивного самосовершенствования. США + Китай + другие

4. Зачем нужно время?
Дополнительные 1–2 года позволят:
Улучшить операционное совершенство — сложнейшие тренировки с тысячами людей и миллионами чипов требуют безошибочного исполнения (как в авиации).
Продвинуть alignment — сделать обучение моделей безопасным и этичным.
Развить интерпретируемость — понять, что происходит внутри моделей (как фМРТ для «мозга» ИИ).
Усилить тестирование — более умные модели лучше обманывают проверки.

5. Геополитический аспект
Сдерживание внутри демократий ограничено отставанием от Китая. Нельзя замедляться сильнее, чем это безопасно. Меры для сохранения лидерства США:
Запрет на продажу мощных чипов и оборудования для их производства Китаю.
Борьба с нелегальной дистилляцией моделей.
Защита весов моделей от кражи.

6. Уровни глобальных соглашений (от простого к сложному)
Запрет явно опасных применений (биооружие).
Обязательное тестирование моделей перед выпуском.
«Ограничение скорости» рекурсивного самосовершенствования (аналогия с договорами SALT).
Полное замедление или пауза — маловероятно в ближайшее время.

Главный вывод
Амодеи не отказывается от своей веры в колоссальную пользу ИИ. Но он настаивает: выгоды будут достигнуты только при правильном темпе. Прогресс всё равно останется быстрым, а выигранное время нужно потратить на интерпретируемость, операционную строгость и уверенность в alignment моделей. Это «долг человечеству», который стоит попытаться выплатить.

Tuesday, September 22, 2026

Выявление и противодействие неправомерному использованию ИИ

Anthropic опубликовала интересный отчет: Выявление и противодействие неправомерному использованию ИИ: сентябрь 2026 г.. Предыдущий подобный отчет был выпущен в ноябре 2025, зв прошедший год, естественно, много что изменилось.

В данном отчете описывается деятельность, пресеченная компанией в период с декабря 2025 года по август 2026 года и затрагивающая семь областей, связанных с потенциальным вредом: кибероперации, операции по оказанию влияния, слежка, мошенничество, неправомерное использование биологических технологий, разработка обычных вооружений и дистилляция. При этом использовались модели Claude Haiku, Sonnet и Opus. Ни в одном из случаев неправомерного использования не были задействованы модели классов Claude Fable или Mythos — за исключением одного случая незаконной дистилляции.

Sunday, September 20, 2026

edas.info

Перестал открываться из России ...

Китайская защита ИИ

Впервые Китай включил сценарий возможной потери контроля над ИИ в будущем в документ, определяющий принципы безопасности этой технологии; он был опубликован в сентябре 2024 года под эгидой Управления по вопросам киберпространства Китая (CAC).
В документе отмечалось, что нельзя исключать вероятность того, что в будущем ИИ сможет автономно получать доступ к внешним ресурсам, самовоспроизводиться, обрести самосознание и стремиться к получению власти, создавая тем самым риск соперничества с человеком за контроль. В сентябре 2025 года CAC выпустило расширенную версию документа. В новой редакции сценарий был детализирован: указывалось, что ИИ может совершить внезапный и неожиданно масштабный «скачок» в развитии интеллекта, прежде чем приступить к захвату ресурсов, самовоспроизведению и борьбе за власть. Также был добавлен принцип управления, сформулированный как «обеспечение надежности применения и предотвращение потери контроля».
В опубликованном позднее на сайте регулятора экспертном комментарии пояснялось, что этот принцип призван защитить от рисков потери контроля, угрожающих выживанию и развитию человечества, и учитывает возможный сценарий выхода ИИ из-под контроля.

ИНОЙ ПОДХОД К ТЕМПАМ РАЗВИТИЯ Подход китайских регулирующих органов отличается от позиции, популярной в некоторых западных кругах, занимающихся вопросами безопасности ИИ: там призывают разработчиков замедлить или приостановить создание наиболее мощных моделей до тех пор, пока не будут внедрены надежные механизмы защиты. Вместо этого с начала года Китай активно продвигает внедрение ИИ во все отрасли экономики, стремясь сделать эту технологию новым двигателем роста второй по величине экономики мира. В то же время Китай демонстрирует готовность отложить запуск технологий, если официальные лица сочтут, что нормативная база еще не готова. Так, в 2023 году китайские компании на несколько месяцев отложили выпуск чат-ботов, ожидая, пока CAC завершит разработку правил регулирования сервисов на базе генеративного ИИ. Выпуск ряда крупных продуктов состоялся уже после того, как эти правила вступили в силу в августе того же года. - отсюда

Saturday, September 19, 2026

6 сигма для агентов

Большие языковые модели (LLM) демонстрируют впечатляющие возможности, однако остаются по своей сути вероятностными системами, что создает серьезные проблемы с надежностью при их внедрении в корпоративной среде. Мы представляем «Six Sigma Agent» — новую архитектуру, обеспечивающую надежность корпоративного уровня благодаря трем взаимодополняющим компонентам: (1) декомпозиции задачи на дерево зависимостей, состоящее из атомарных действий; (2) выборке с использованием микроагентов, при которой каждая задача выполняется параллельно n раз с привлечением различных LLM для получения независимых результатов; и (3) голосованию для достижения консенсуса с динамическим масштабированием, включающему кластеризацию результатов и выбор ответа из кластера, набравшего наибольшее число голосов. Мы доказываем, что получение n независимых результатов при уровне ошибок p позволяет снизить системную ошибку до уровня O(p^[n/2]), обеспечивая экспоненциальный рост надежности. Даже при использовании менее дорогих моделей с вероятностью ошибки 5% на одно действие голосование с участием 5 агентов снижает уровень ошибок до 0,11%, а динамическое масштабирование до 13 агентов позволяет достичь показателя 3,4 DPMO (дефектов на миллион возможностей), что соответствует стандарту «Шесть сигм». Оценка эффективности на трех корпоративных сценариях использования показала повышение надежности в 14 700 раз по сравнению с выполнением задачи одним агентом при одновременном снижении затрат на 80%. Наша работа подтверждает, что надежность систем искусственного интеллекта достигается за счет обоснованного резервирования и механизма консенсуса, а не только благодаря масштабированию самих моделей. - The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

Friday, September 18, 2026

Разработка безопасного программного обеспечения. Общие требования

Детальный разбор ГОСТ Р 56939‑2024

Стандарт описывает 25 процессов, внедрение которых способствует зрелости цикла разработки и, как следствие, качеству, надёжности и безопасности разрабатываемых программных проектов.

Wednesday, September 16, 2026

О безопасности мультиагентных систем

В мультиагентных приложениях на базе LLM цепочка компонентов включает планировщик, агентов-исполнителей, верификатор и синтезатор; при этом каждый канал передачи данных между агентами остается неконтролируемым, что позволяет злоумышленнику внедрять вредоносные инструкции. Существующие средства защиты либо контролируют только входной интерфейс (IBProtector, Llama Guard, фильтры перплексии, SmoothLLM), либо работают вне приложения как непрозрачные стохастические фильтры контента на стороне провайдера. Мы показываем, что этот пробел влечет за собой последствия, которые редко учитываются на практике: в ходе оценки по 2100 сценариям (охватывающим восемь семейств атак, пять методов защиты и три базовые модели) выяснилось, что конвейер без специальной защиты, демонстрирующий полную безопасность согласно стандартным метрикам (нулевой уровень успеха атак типа «отравление инструментов» и «отравление памяти»), обязан этой безопасностью почти исключительно серверному фильтру облачного провайдера (54 из 60 блокировок в Azure GPT-5); при запуске на платформе без такого фильтра защита обеспечивается исключительно за счет механизмов согласования (alignment) самой модели-агента. Отчетность, учитывающая лишь конечный результат, скрывает эту зависимость. Мы представляем ChannelGuard — систему эшелонированной защиты, не требующую дообучения моделей и использующую шлюзы на основе принципа информационного «узкого места» (IB) для каждого канала связи между агентами. Каждый шлюз оценивает текст в канале, сравнивая его с базой данных вредоносных фраз (на основе сходства эмбеддингов предложений), и детерминированно пропускает, сжимает или блокирует сообщение, не прибегая к дополнительным вызовам LLM; при этом метод атрибуции фиксирует, на каком именно уровне была впервые остановлена атака. Шлюз ChannelGuard, контролирующий выходные данные инструментов, блокирует все 30 из 30 попыток «отравления инструментов» на уровне приложения, причем эффективность остается неизменной для моделей Azure GPT-5, Anthropic Sonnet 4.5 и Anthropic Haiku 4.5 (тогда как механизмы защиты в незащищенном конвейере существенно различаются в зависимости от используемой модели). Кроме того, ChannelGuard снижает вероятность успеха атак типа «инъекция промпта» на 50% (с 0,333 до 0,167) и сохраняет точность решения задач GSM8K на прежнем уровне (0,867). Мы также четко обозначаем ограничения метода: адаптивное перефразирование в условиях «белого ящика» позволяет обойти любой шлюз, основанный на эмбеддингах, — в таких случаях более эффективным оказывается базовый метод, использующий возмущение входных данных и голосование (perturb-and-vote). В расширенном приложении представлены четыре базовых решения, результаты абляционных исследований, данные перебора гиперпараметров, анализ сохранения безопасных примеров, а также аудит оценок, выполненный судьями из разных семейств моделей (𝜅=0,900); общие затраты составили 47,36 доллара. - ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

См. также другие публикации, посвященные агентам

Tuesday, September 15, 2026

О защите мультимодальных моделей

Мультимодальные большие языковые модели (MLLM) продемонстрировали впечатляющие возможности в широком спектре генеративных задач. Однако внедрение нетекстовых модальностей создает серьезные проблемы для обеспечения безопасности (alignment). MLLM часто отклоняют небезопасные текстовые запросы, но при этом выдают вредные ответы на семантически эквивалентные мультимодальные входные данные. Существующие стратегии защиты, включая внешние фильтры (guardrails) и дообучение с упором на безопасность, по большей части упускают из виду механизмы, лежащие в основе этого дисбаланса. Внешние фильтры лишь обходят внутренние недостатки модели, а дообучение рассматривает задачу согласования как оптимизацию «черного ящика», не выявляя и не устраняя конкретный изъян. В результате эти методы либо приводят к значительным задержкам при генерации (инференсе) при ограниченной защите, либо существенно снижают полезность модели и требуют огромных объемов мультимодальных данных. Таким образом, обеспечение эффективной и сохраняющей полезность защиты MLLM остается нерешенной задачей. В данной работе мы проводим геометрический анализ представлений MLLM, чтобы выяснить причины снижения уровня безопасности в мультимодальном режиме. Мы обнаружили, что механизмы безопасности, сформированные в чисто текстовой модальности, сохраняются и в мультимодальной среде. Подпространство безопасности с границей отказа остается актуальным для различных модальностей: представления, попадающие внутрь этой границы, неизменно вызывают безопасный отказ от выполнения запроса. Однако мы наблюдаем критический сдвиг в представлениях, из-за которого большинство небезопасных мультимодальных входных данных оказываются за пределами границы и обходят этот внутренний механизм. Это открытие позволяет определить, что первопричиной сбоев в системе безопасности при работе с мультимодальными данными является именно сдвиг представлений, а не отсутствие у модели соответствующих возможностей. Опираясь на это наблюдение, мы предлагаем MMAligner — метод защиты MLLM, основанный на калибровке представлений. В отличие от существующих подходов, MMAligner устраняет этот сдвиг, оптимизируя модель так, чтобы она отображала небезопасные мультимодальные представления внутрь уже существующей границы отказа. В частности, метод использует жесткую нижнюю границу для гарантии отказа и мягкую верхнюю границу для предотвращения чрезмерных изменений, сохраняя при этом представления для безопасных (корректных) входных данных. Обширные эксперименты с использованием различных MLLM с открытым исходным кодом показывают, что MMAligner повышает средний уровень отказа при обработке небезопасных мультимодальных данных до 99%, снижая полезность модели менее чем на 2% и требуя минимального объема данных; это значительно превосходит показатели существующих базовых методов с точки зрения баланса между безопасностью и полезностью. - MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

См. также другие публикации, посвященные MLLM