Friday, September 11, 2026

Бэкдоры в ИИ-агентах

Агенты LLM с открытыми весами уязвимы для бэкдоров, установленных во время тонкой настройки, которые могут быть необнаружимы, если условия срабатывания никогда не выполняются во время тестирования. Предполагая, что защитники не знают существующего триггера, они не могут напрямую отменить его. Одна из стратегий дезактивации заключается в установке известного бэкдора (защитное отравление), а затем в его отмене, в надежде, что исходный неизвестный бэкдор будет удален в качестве побочного эффекта. Однако эта процедура имеет неопределенные результаты: исходный бэкдор может сохраниться, быть стерт или перенаправлен, среди прочих возможностей. Мы представляем структуру для изучения этой динамики в агентах, вызывающих инструменты, разделяя триггер, реакцию, учителя и метод тонкой настройки в ходе систематических экспериментов на AgentDyn. В 115 экспериментах только защитное отравление стирает ~56% исходных бэкдоров; последующая дезактивация затем приводит к удалению почти всех выживших, подтверждая, что распознавание триггера и вредоносное выполнение поведенчески различимы. Интересно, что наши эксперименты показывают, что вредоносные бэкдоры никогда не сохраняются при использовании различных триггеров того же общего типа, что и защитный бэкдор, после чего следует дезактивация путем разучивания. Совместная установка до четырех бэкдоров повышает устойчивость (удалено ~36%), однако дезактивация одного известного совместного бэкдора приводит к удалению 52 из 60 совместно содержащихся бэкдоров (87%). При визуализации внутренних структур модели после дезактивации с помощью J-линз мы подтверждаем, что, хотя дезактивация восстанавливает доброкачественные реакции LLM, следы первоначального осознания триггера сохраняются на промежуточных уровнях. - Backdoor Decontamination Dynamics in LLM Agents

См. также другие публикации, посвященные агентам

No comments: