См. также другие публикации, посвященные агентам
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Wednesday, September 16, 2026
О безопасности мультиагентных систем
В мультиагентных приложениях на базе LLM цепочка компонентов включает планировщик, агентов-исполнителей, верификатор и синтезатор; при этом каждый канал передачи данных между агентами остается неконтролируемым, что позволяет злоумышленнику внедрять вредоносные инструкции. Существующие средства защиты либо контролируют только входной интерфейс (IBProtector, Llama Guard, фильтры перплексии, SmoothLLM), либо работают вне приложения как непрозрачные стохастические фильтры контента на стороне провайдера. Мы показываем, что этот пробел влечет за собой последствия, которые редко учитываются на практике: в ходе оценки по 2100 сценариям (охватывающим восемь семейств атак, пять методов защиты и три базовые модели) выяснилось, что конвейер без специальной защиты, демонстрирующий полную безопасность согласно стандартным метрикам (нулевой уровень успеха атак типа «отравление инструментов» и «отравление памяти»), обязан этой безопасностью почти исключительно серверному фильтру облачного провайдера (54 из 60 блокировок в Azure GPT-5); при запуске на платформе без такого фильтра защита обеспечивается исключительно за счет механизмов согласования (alignment) самой модели-агента. Отчетность, учитывающая лишь конечный результат, скрывает эту зависимость. Мы представляем ChannelGuard — систему эшелонированной защиты, не требующую дообучения моделей и использующую шлюзы на основе принципа информационного «узкого места» (IB) для каждого канала связи между агентами. Каждый шлюз оценивает текст в канале, сравнивая его с базой данных вредоносных фраз (на основе сходства эмбеддингов предложений), и детерминированно пропускает, сжимает или блокирует сообщение, не прибегая к дополнительным вызовам LLM; при этом метод атрибуции фиксирует, на каком именно уровне была впервые остановлена атака. Шлюз ChannelGuard, контролирующий выходные данные инструментов, блокирует все 30 из 30 попыток «отравления инструментов» на уровне приложения, причем эффективность остается неизменной для моделей Azure GPT-5, Anthropic Sonnet 4.5 и Anthropic Haiku 4.5 (тогда как механизмы защиты в незащищенном конвейере существенно различаются в зависимости от используемой модели). Кроме того, ChannelGuard снижает вероятность успеха атак типа «инъекция промпта» на 50% (с 0,333 до 0,167) и сохраняет точность решения задач GSM8K на прежнем уровне (0,867). Мы также четко обозначаем ограничения метода: адаптивное перефразирование в условиях «белого ящика» позволяет обойти любой шлюз, основанный на эмбеддингах, — в таких случаях более эффективным оказывается базовый метод, использующий возмущение входных данных и голосование (perturb-and-vote). В расширенном приложении представлены четыре базовых решения, результаты абляционных исследований, данные перебора гиперпараметров, анализ сохранения безопасных примеров, а также аудит оценок, выполненный судьями из разных семейств моделей (𝜅=0,900); общие затраты составили 47,36 доллара. - ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems
Subscribe to:
Post Comments (Atom)
No comments:
Post a Comment