Sunday, September 20, 2026

edas.info

Перестал открываться из России ...

Китайская защита ИИ

Впервые Китай включил сценарий возможной потери контроля над ИИ в будущем в документ, определяющий принципы безопасности этой технологии; он был опубликован в сентябре 2024 года под эгидой Управления по вопросам киберпространства Китая (CAC).
В документе отмечалось, что нельзя исключать вероятность того, что в будущем ИИ сможет автономно получать доступ к внешним ресурсам, самовоспроизводиться, обрести самосознание и стремиться к получению власти, создавая тем самым риск соперничества с человеком за контроль. В сентябре 2025 года CAC выпустило расширенную версию документа. В новой редакции сценарий был детализирован: указывалось, что ИИ может совершить внезапный и неожиданно масштабный «скачок» в развитии интеллекта, прежде чем приступить к захвату ресурсов, самовоспроизведению и борьбе за власть. Также был добавлен принцип управления, сформулированный как «обеспечение надежности применения и предотвращение потери контроля».
В опубликованном позднее на сайте регулятора экспертном комментарии пояснялось, что этот принцип призван защитить от рисков потери контроля, угрожающих выживанию и развитию человечества, и учитывает возможный сценарий выхода ИИ из-под контроля.

ИНОЙ ПОДХОД К ТЕМПАМ РАЗВИТИЯ Подход китайских регулирующих органов отличается от позиции, популярной в некоторых западных кругах, занимающихся вопросами безопасности ИИ: там призывают разработчиков замедлить или приостановить создание наиболее мощных моделей до тех пор, пока не будут внедрены надежные механизмы защиты. Вместо этого с начала года Китай активно продвигает внедрение ИИ во все отрасли экономики, стремясь сделать эту технологию новым двигателем роста второй по величине экономики мира. В то же время Китай демонстрирует готовность отложить запуск технологий, если официальные лица сочтут, что нормативная база еще не готова. Так, в 2023 году китайские компании на несколько месяцев отложили выпуск чат-ботов, ожидая, пока CAC завершит разработку правил регулирования сервисов на базе генеративного ИИ. Выпуск ряда крупных продуктов состоялся уже после того, как эти правила вступили в силу в августе того же года. - отсюда

Saturday, September 19, 2026

6 сигма для агентов

Большие языковые модели (LLM) демонстрируют впечатляющие возможности, однако остаются по своей сути вероятностными системами, что создает серьезные проблемы с надежностью при их внедрении в корпоративной среде. Мы представляем «Six Sigma Agent» — новую архитектуру, обеспечивающую надежность корпоративного уровня благодаря трем взаимодополняющим компонентам: (1) декомпозиции задачи на дерево зависимостей, состоящее из атомарных действий; (2) выборке с использованием микроагентов, при которой каждая задача выполняется параллельно n раз с привлечением различных LLM для получения независимых результатов; и (3) голосованию для достижения консенсуса с динамическим масштабированием, включающему кластеризацию результатов и выбор ответа из кластера, набравшего наибольшее число голосов. Мы доказываем, что получение n независимых результатов при уровне ошибок p позволяет снизить системную ошибку до уровня O(p^[n/2]), обеспечивая экспоненциальный рост надежности. Даже при использовании менее дорогих моделей с вероятностью ошибки 5% на одно действие голосование с участием 5 агентов снижает уровень ошибок до 0,11%, а динамическое масштабирование до 13 агентов позволяет достичь показателя 3,4 DPMO (дефектов на миллион возможностей), что соответствует стандарту «Шесть сигм». Оценка эффективности на трех корпоративных сценариях использования показала повышение надежности в 14 700 раз по сравнению с выполнением задачи одним агентом при одновременном снижении затрат на 80%. Наша работа подтверждает, что надежность систем искусственного интеллекта достигается за счет обоснованного резервирования и механизма консенсуса, а не только благодаря масштабированию самих моделей. - The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

Friday, September 18, 2026

Разработка безопасного программного обеспечения. Общие требования

Детальный разбор ГОСТ Р 56939‑2024

Стандарт описывает 25 процессов, внедрение которых способствует зрелости цикла разработки и, как следствие, качеству, надёжности и безопасности разрабатываемых программных проектов.

Wednesday, September 16, 2026

О безопасности мультиагентных систем

В мультиагентных приложениях на базе LLM цепочка компонентов включает планировщик, агентов-исполнителей, верификатор и синтезатор; при этом каждый канал передачи данных между агентами остается неконтролируемым, что позволяет злоумышленнику внедрять вредоносные инструкции. Существующие средства защиты либо контролируют только входной интерфейс (IBProtector, Llama Guard, фильтры перплексии, SmoothLLM), либо работают вне приложения как непрозрачные стохастические фильтры контента на стороне провайдера. Мы показываем, что этот пробел влечет за собой последствия, которые редко учитываются на практике: в ходе оценки по 2100 сценариям (охватывающим восемь семейств атак, пять методов защиты и три базовые модели) выяснилось, что конвейер без специальной защиты, демонстрирующий полную безопасность согласно стандартным метрикам (нулевой уровень успеха атак типа «отравление инструментов» и «отравление памяти»), обязан этой безопасностью почти исключительно серверному фильтру облачного провайдера (54 из 60 блокировок в Azure GPT-5); при запуске на платформе без такого фильтра защита обеспечивается исключительно за счет механизмов согласования (alignment) самой модели-агента. Отчетность, учитывающая лишь конечный результат, скрывает эту зависимость. Мы представляем ChannelGuard — систему эшелонированной защиты, не требующую дообучения моделей и использующую шлюзы на основе принципа информационного «узкого места» (IB) для каждого канала связи между агентами. Каждый шлюз оценивает текст в канале, сравнивая его с базой данных вредоносных фраз (на основе сходства эмбеддингов предложений), и детерминированно пропускает, сжимает или блокирует сообщение, не прибегая к дополнительным вызовам LLM; при этом метод атрибуции фиксирует, на каком именно уровне была впервые остановлена атака. Шлюз ChannelGuard, контролирующий выходные данные инструментов, блокирует все 30 из 30 попыток «отравления инструментов» на уровне приложения, причем эффективность остается неизменной для моделей Azure GPT-5, Anthropic Sonnet 4.5 и Anthropic Haiku 4.5 (тогда как механизмы защиты в незащищенном конвейере существенно различаются в зависимости от используемой модели). Кроме того, ChannelGuard снижает вероятность успеха атак типа «инъекция промпта» на 50% (с 0,333 до 0,167) и сохраняет точность решения задач GSM8K на прежнем уровне (0,867). Мы также четко обозначаем ограничения метода: адаптивное перефразирование в условиях «белого ящика» позволяет обойти любой шлюз, основанный на эмбеддингах, — в таких случаях более эффективным оказывается базовый метод, использующий возмущение входных данных и голосование (perturb-and-vote). В расширенном приложении представлены четыре базовых решения, результаты абляционных исследований, данные перебора гиперпараметров, анализ сохранения безопасных примеров, а также аудит оценок, выполненный судьями из разных семейств моделей (𝜅=0,900); общие затраты составили 47,36 доллара. - ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems

См. также другие публикации, посвященные агентам

Tuesday, September 15, 2026

О защите мультимодальных моделей

Мультимодальные большие языковые модели (MLLM) продемонстрировали впечатляющие возможности в широком спектре генеративных задач. Однако внедрение нетекстовых модальностей создает серьезные проблемы для обеспечения безопасности (alignment). MLLM часто отклоняют небезопасные текстовые запросы, но при этом выдают вредные ответы на семантически эквивалентные мультимодальные входные данные. Существующие стратегии защиты, включая внешние фильтры (guardrails) и дообучение с упором на безопасность, по большей части упускают из виду механизмы, лежащие в основе этого дисбаланса. Внешние фильтры лишь обходят внутренние недостатки модели, а дообучение рассматривает задачу согласования как оптимизацию «черного ящика», не выявляя и не устраняя конкретный изъян. В результате эти методы либо приводят к значительным задержкам при генерации (инференсе) при ограниченной защите, либо существенно снижают полезность модели и требуют огромных объемов мультимодальных данных. Таким образом, обеспечение эффективной и сохраняющей полезность защиты MLLM остается нерешенной задачей. В данной работе мы проводим геометрический анализ представлений MLLM, чтобы выяснить причины снижения уровня безопасности в мультимодальном режиме. Мы обнаружили, что механизмы безопасности, сформированные в чисто текстовой модальности, сохраняются и в мультимодальной среде. Подпространство безопасности с границей отказа остается актуальным для различных модальностей: представления, попадающие внутрь этой границы, неизменно вызывают безопасный отказ от выполнения запроса. Однако мы наблюдаем критический сдвиг в представлениях, из-за которого большинство небезопасных мультимодальных входных данных оказываются за пределами границы и обходят этот внутренний механизм. Это открытие позволяет определить, что первопричиной сбоев в системе безопасности при работе с мультимодальными данными является именно сдвиг представлений, а не отсутствие у модели соответствующих возможностей. Опираясь на это наблюдение, мы предлагаем MMAligner — метод защиты MLLM, основанный на калибровке представлений. В отличие от существующих подходов, MMAligner устраняет этот сдвиг, оптимизируя модель так, чтобы она отображала небезопасные мультимодальные представления внутрь уже существующей границы отказа. В частности, метод использует жесткую нижнюю границу для гарантии отказа и мягкую верхнюю границу для предотвращения чрезмерных изменений, сохраняя при этом представления для безопасных (корректных) входных данных. Обширные эксперименты с использованием различных MLLM с открытым исходным кодом показывают, что MMAligner повышает средний уровень отказа при обработке небезопасных мультимодальных данных до 99%, снижая полезность модели менее чем на 2% и требуя минимального объема данных; это значительно превосходит показатели существующих базовых методов с точки зрения баланса между безопасностью и полезностью. - MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

См. также другие публикации, посвященные MLLM

Monday, September 14, 2026

Пентестинг для ИИ-агентов

В традиционном тестировании на проникновение (пентестинге) на каждом этапе применяется разведка для выявления скрытых уязвимостей, подготовки более эффективных атак и продвижения к цели; мы утверждаем, что к ИИ-агентам следует применять аналогичный подход. Мы формализуем процесс разведки агентов, моделируя его и определяя информационные активы, которые пытается извлечь злоумышленник: что они собой представляют, как используются и какие уязвимости агента эксплуатируют, предоставляя атакующему преимущество при проведении атак типа «непрямая инъекция промпта» (indirect prompt injection). Эти идеи реализованы в KYA (Know Your Agent) — фреймворке, автоматизирующем тестирование на проникновение методом «черного ящика» с опорой на разведку; система зондирует агентов, формирует профили целей и использует их для создания более мощных атак. Мы оцениваем эффективность KYA с помощью специализированных наборов тестов (бенчмарков) и на примере реального агента для написания кода, а также публикуем сам фреймворк, бенчмарки и базовые реализации для обеспечения воспроизводимости результатов. - Know Your Agent: Reconnaissance-Driven Pentesting of AI Agents

См. также другие публикации, посвященные агентам

Saturday, September 12, 2026

ИИ атакует

Когда атакует машина: как генеративный ИИ переписал правила кибервойны

За тридцать лет индустрия информационной безопасности пережила несколько технологических сдвигов, но ни один из них не менял расстановку сил так быстро, как генеративный ИИ. Раньше между появлением нового класса атак и его массовым применением проходили годы: злоумышленникам нужно было время, квалификация и инфраструктура. Сегодня этот барьер обрушился. Написать фишинговое письмо на безупречном русском, собрать досье на жертву, сгенерировать вариант вредоносного кода, обходящий сигнатурный детектор — всё это стало доступно человеку без глубокой технической подготовки и занимает минуты, а не недели. Рассмотрим, как эволюционировали методы кибератак с появлением ИИ.

Friday, September 11, 2026

Бэкдоры в ИИ-агентах

Агенты LLM с открытыми весами уязвимы для бэкдоров, установленных во время тонкой настройки, которые могут быть необнаружимы, если условия срабатывания никогда не выполняются во время тестирования. Предполагая, что защитники не знают существующего триггера, они не могут напрямую отменить его. Одна из стратегий дезактивации заключается в установке известного бэкдора (защитное отравление), а затем в его отмене, в надежде, что исходный неизвестный бэкдор будет удален в качестве побочного эффекта. Однако эта процедура имеет неопределенные результаты: исходный бэкдор может сохраниться, быть стерт или перенаправлен, среди прочих возможностей. Мы представляем структуру для изучения этой динамики в агентах, вызывающих инструменты, разделяя триггер, реакцию, учителя и метод тонкой настройки в ходе систематических экспериментов на AgentDyn. В 115 экспериментах только защитное отравление стирает ~56% исходных бэкдоров; последующая дезактивация затем приводит к удалению почти всех выживших, подтверждая, что распознавание триггера и вредоносное выполнение поведенчески различимы. Интересно, что наши эксперименты показывают, что вредоносные бэкдоры никогда не сохраняются при использовании различных триггеров того же общего типа, что и защитный бэкдор, после чего следует дезактивация путем разучивания. Совместная установка до четырех бэкдоров повышает устойчивость (удалено ~36%), однако дезактивация одного известного совместного бэкдора приводит к удалению 52 из 60 совместно содержащихся бэкдоров (87%). При визуализации внутренних структур модели после дезактивации с помощью J-линз мы подтверждаем, что, хотя дезактивация восстанавливает доброкачественные реакции LLM, следы первоначального осознания триггера сохраняются на промежуточных уровнях. - Backdoor Decontamination Dynamics in LLM Agents

См. также другие публикации, посвященные агентам

Thursday, September 10, 2026

Уязвимости в связке LLM и веб-приложений

Большие языковые модели все чаще интегрируются в веб-приложения посредством чат-ботов, конвейеров вызова инструментов и агентных рабочих процессов. В этих системах пользовательский ввод может влиять не только на генерируемый текст, но и на действия бэкэнда, такие как запросы к базе данных, HTTP-запросы, операции с файлами, рендеринг шаблонов или вызовы API. В этой статье представлены веб-атаки с использованием больших языковых моделей (LLM), класс атак, при которых контролируемый злоумышленником ввод преобразуется интегрированным в LLM приложением, а затем достигает традиционных приемников веб-приложений. Мы систематизируем эту поверхность атаки с помощью репрезентативных вариантов LLM2X, включая LLM2SQLi, LLM2XSS, LLM2SSTI, LLM2CommandInjection, LLM2IDOR, LLM2CSRF, LLM2XXE и LLM2 SSRF. Наш анализ показывает, что LLM обычно не создает саму лежащую в основе уязвимость; Скорее, он действует как посреднический слой, а в некоторых настройках с поддержкой инструментов — как дезориентированный заместитель, переносящий влияние злоумышленника в компоненты, которые доверяют контенту, сгенерированному моделью или на который влияет модель. В качестве экспериментального примера мы реализуем TicketOracle, веб-приложение на основе Flask, интегрированное с LLM, для оценки LLM2SSRF в пяти сценариях атак и семи LLM. Наши результаты показывают существенные различия в уязвимости в зависимости от модели, что предполагает, что эксплуатация зависит как от небезопасной архитектуры приложения, так и от поведения, специфичного для модели. В заключение мы предлагаем стратегии смягчения последствий на уровнях подсказки, модели, приложения и сети. - From Prompt Injection to Web Exploitation: Revisiting Classic Vulnerabilities in LLM-Integrated Applications

См. также другие публикации, посвященные LLM

Wednesday, September 09, 2026

Fine tuning vs. RAG

Общее правило, которым руководствуются большинство специалистов: RAG в основном расширяет знания модели. Тонкая настройка в основном влияет на поведение выходных данных. - How to Fine-Tune an LLM: An End-to-End Guide

Tuesday, September 08, 2026

Вечные бэкдоры

Люди способны к стратегическому обману: в большинстве ситуаций они ведут себя полезно, но затем, получив возможность, резко меняют свое поведение, чтобы преследовать альтернативные цели. Если бы система ИИ научилась такой обманной стратегии, смогли бы мы обнаружить и устранить ее, используя современные методы обучения безопасности? Для изучения этого вопроса мы создаем демонстрационные примеры обманного поведения в больших языковых моделях (LLM). Например, мы обучаем модели, которые пишут безопасный код, когда в подсказке указано, что год 2023, но вставляют уязвимый код, когда указан год 2024. Мы обнаруживаем, что такое поведение типа «бэкдор» может быть устойчивым, так что его не удаляют стандартные методы обучения безопасности, включая контролируемую тонкую настройку, обучение с подкреплением и состязательное обучение (вызывание небезопасного поведения, а затем обучение его устранению). Поведение типа «бэкдор» наиболее устойчиво в самых больших моделях и в моделях, обученных создавать цепочку рассуждений о том, как обмануть процесс обучения, причем устойчивость сохраняется даже после удаления цепочки рассуждений. Кроме того, вместо удаления бэкдоров, мы обнаружили, что состязательное обучение может научить модели лучше распознавать триггеры своих бэкдоров, эффективно скрывая небезопасное поведение. Наши результаты показывают, что, как только модель начинает демонстрировать обманчивое поведение, стандартные методы могут оказаться неспособными устранить такой обман и создать ложное впечатление безопасности. - Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training

См. также другие публикации, посвященные LLM

Monday, September 07, 2026

MS кибербез

Компания Microsoft представила свою первую модель ИИ для кибербезопасности, MAI-Cyber-1-Flash, которая, по утверждению компании, показала значительно лучшие результаты в обнаружении уязвимостей, чем её основные конкуренты.

MAI-Cyber-1-Flash, разработанная для выявления сложных уязвимостей в сложном коде, интегрирована в многоагентную систему идентификации и устранения уязвимостей MDASH от Microsoft.

MDASH объединяет более 100 специализированных агентов ИИ в рамках множества передовых и упрощенных моделей ИИ и использовалась для обнаружения множества уязвимостей в собственных кодовых базах технологического гиганта.

По данным Microsoft, тестирование в рамках системы оценки кибербезопасности CyberGym показало, что MAI-Cyber-1-Flash (в сочетании с MDASH и GPT-5.4) превзошла недавно выпущенную Google 3.5 Flash Cyber, OpenAI GPT-5.6 Sol и Anthropic Mythos 5 по обнаружению уязвимостей.

отсюда

Sunday, September 06, 2026