Проблема: Современные методы автоматического "краснокомандования" (red-teaming) для поиска инъекций промптов делятся на два класса, каждый со своими недостатками:
Методы на основе обучения с подкреплением (RL): Очень эффективны, но требуют огромного числа запросов к целевой модели для обучения и плохо переносят полученные навыки на новые модели.
Поисковые методы (search-based): Не требуют обучения, но начинают поиск атаки с нуля для каждого примера, не накапливая опыт, и поэтому значительно уступают RL-методам в эффективности.
Гипотеза: Можно создать агента, который будет накапливать знания об успешных атаках из предыдущего опыта, что позволит поисковым методам достичь эффективности RL-подходов.
2. Предлагаемое решение: PIMiner PIMiner — это агентная система, которая преобразует историю атак в многоуровневую иерархическую память, позволяющую накапливать и эффективно использовать знания.
Ключевые компоненты системы:
Библиотека стратегий (Strategy Library): Хранилище успешных паттернов атак в виде структурированных файлов, которые описывают, для каких моделей и задач стратегия работает, её шаблон, примеры и условия отказа. Это долговременная память системы.
Маршрутизатор стратегий (Strategy Router): Чтобы не загружать всю библиотеку в контекст (что дорого), маршрутизатор для каждого конкретного примера выбирает только Top-K наиболее релевантных стратегий, экономя контекст.
Модуль итеративной атаки (Iterative Attack Module): Непосредственно генерирует атаки, используя три уровня памяти:
Долговременная память: стратегии, выбранные маршрутизатором.
Внутридатасетная память (Intra-dataset): сжатый опыт атак на предыдущие примеры из того же набора данных и модели. Позволяет быстро адаптироваться к конкретной целевой модели.
Внутривыборочная память (Intra-sample): история предыдущих попыток для текущего конкретного примера. Помогает анализировать ошибки и уточнять атаку.
Агент-дигестер (Experience Digester): После завершения работы над всем набором данных, дигестер анализирует все успешные и неудачные атаки и обновляет библиотеку стратегий: добавляет новые стратегии, расширяет область применения существующих или уточняет условия, при которых они не работают.
3. Ключевые результаты экспериментов
Высокая эффективность: PIMiner достигает уровня успешности атак (ASR), сравнимого с лучшими RL-методами, значительно превосходя традиционные поисковые подходы. Например, на бенчмарке InjecAgent PIMiner достиг ASR=1.0 против GPT-4o-mini, GPT-4.1-nano и GPT-5-nano.
Отличная переносимость: Главное преимущество — стратегии, изученные PIMiner на одних моделях (например, GPT-5-nano, Claude-Haiku), напрямую переносятся на новые, ранее невиданные целевые модели (например, Gemini-2.5-Pro, GPT-5.1), без необходимости дообучения. В то время как RL-методы требуют переобучения для каждой новой модели.
Подтверждение гипотезы: Абляционные исследования показали, что каждый уровень памяти вносит вклад в успех, а их комбинация дает максимальный прирост эффективности (до 19.8%).
Экономичность: PIMiner требует всего около 10 итераций атаки на пример и обходится значительно дешевле в плане затрат на API по сравнению с RL-методами, которые могут требовать десятков тысяч запросов.
4. Основной вывод
PIMiner успешно преодолевает разрыв между поисковыми и RL-методами для автоматического поиска инъекций промптов. Система показывает, что накопление и структурирование знаний об атаках в иерархическую память позволяет эффективно искать уязвимости в новых LLM-агентах, не требуя дорогостоящего переобучения для каждой модели. Это делает PIMiner практичным инструментом для аудита безопасности агентных систем.
отсюда - Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
См. также другие публикации, посвященные агентам
No comments:
Post a Comment