На основе структурированного обзора 66 исследований, опубликованных в период с 2022 по 2026 год, мы предлагаем модель T = ⟨S, B, P, A⟩ — многомерное представление, связывающее затронутые функциональные или системные области (S), границы взаимодействия или доверия (B), нарушенные свойства безопасности (P) и архитектуры, изученные эмпирическим путем (A). Мы анализируем 22 исследования, включающих практические эксперименты по тестированию на проникновение (red-teaming), и 11 репрезентативных бенчмарков безопасности, чтобы оценить полноту эмпирического охвата и уровень зрелости методов оценки. В рассмотренных работах основное внимание уделяется атакам, связанным с промптами и процессами рассуждения (reasoning), памятью и использованием инструментов, причем преимущественно в сценариях с одним агентом. Угрозы, связанные с сохраняемым состоянием, взаимодействием «человек-агент», сложными мультиагентными системами, системными уязвимостями и долгосрочными сценариями работы, изучены в меньшей степени. Полученные результаты характеризуют выбранный массив исследований, а не указывают на пробелы во всей области эмпирических изысканий в целом. Разнородность метрик, недостаточная оценка адаптивных механизмов защиты, архитектурный дисбаланс и неполная фиксация состояния выполнения затрудняют сопоставление результатов и их воспроизводимость. Мы формулируем 13 открытых исследовательских вопросов, призванных способствовать более систематическому, учитывающему архитектурные особенности и воспроизводимому подходу к оценке безопасности агентного ИИ. - Connecting the Dots in Agentic AI Security: A Cross-Dimensional Threat Taxonomy, Evaluation Maturity, and Open Challenges
См. также другие публикации, посвященные агентам
No comments:
Post a Comment