Showing posts sorted by date for query causal. Sort by relevance Show all posts
Showing posts sorted by date for query causal. Sort by relevance Show all posts

Thursday, March 26, 2026

Караул для агентов

Агенты, использующие большие языковые модели (LLM), все чаще полагаются на внешние инструменты и системы поиска для автономного выполнения сложных задач. Однако такая конструкция делает агентов уязвимыми для косвенного внедрения подсказок (IPI), когда контролируемый злоумышленником контекст, встроенный в выходные данные инструмента или полученный контент, незаметно направляет действия агента в сторону, противоположную намерениям пользователя. В отличие от атак на основе подсказок, IPI разворачивается на протяжении нескольких циклов, что затрудняет отделение вредоносного управления от легитимного выполнения задачи. Существующие средства защиты на этапе вывода в основном полагаются на эвристическое обнаружение и консервативную блокировку действий с высоким риском, что может преждевременно завершать рабочие процессы или в целом подавлять использование инструментов в неоднозначных многоцикловых сценариях. Мы предлагаем AgentSentry, новую структуру обнаружения и смягчения последствий на этапе вывода для агентов LLM, дополненных инструментами. Насколько нам известно, AgentSentry — это первая система защиты на этапе вывода, которая моделирует многоцикловое внедрение подсказок как временное причинно-следственное поглощение. Он локализует точки захвата посредством контролируемых контрфактических повторных выполнений на границах возврата инструмента и обеспечивает безопасное продолжение работы за счет причинно-следственной очистки контекста, которая устраняет отклонения, вызванные атакой, сохраняя при этом релевантные для задачи доказательства. Мы оцениваем AgentSentry на бенчмарке AgentDojo по четырем наборам задач, трем семействам атак IPI и нескольким моделям LLM типа «черный ящик». AgentSentry исключает успешные атаки и поддерживает высокую полезность при атаке, достигая средней полезности при атаке (UA) 74,55%, улучшая UA на 20,8–33,6 процентных пункта по сравнению с самыми сильными базовыми показателями без ухудшения производительности в условиях безопасной среды. - AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

См. также другие публикации, посвященные агентам

Monday, October 20, 2025

Wednesday, April 09, 2025

ML & Causal

Модели машинного обучения могут предсказывать что будет по историческим данным. Например, будушие продажи по историческим данным. А если мы хотим предсказать, какие будут продажи при условии установки скидки? Как соединить машинное обучение и каузальность? - Double ML: Bridging the Gap Between Machine Learning and Causal Inference

см. также другие публикации, посвященные каузальности

Monday, February 10, 2025

Шифрованные атаки

Шифрование трафика широко применяется для защиты конфиденциальности и целостности интернет-трафика. Однако злоумышленники также могут злоупотреблять таким механизмом для доставки вредоносного трафика. В частности, существующие методы обнаружения зашифрованного вредоносного трафика не являются надежными против атак уклонения, которые манипулируют трафиком для сокрытия характеристик трафика. Надежное обнаружение атак уклонения остается открытой проблемой. В конце концов, мы разрабатываем Wedjat, который использует причинно-следственную сеть для моделирования доброкачественных взаимодействий пакетов между соответствующими потоками, таким образом, что он распознает аномальную причинно-следственную связь, которая представляет собой вредоносный трафик и нарушенную причинно-следственную связь, вызванную атаками уклонения. - Wedjat: Detecting Sophisticated Evasion Attacks via Real-time Causal Analysis

P.S. См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Wednesday, March 13, 2024

Causal ML

Книга в открытом доступе Causal ML Book

см. также другие публикации, посвященные каузальности

Monday, August 21, 2023

Saturday, October 08, 2022

Скажи почему?

DoWhy - Python библиотека с открытым кодом для каузального анализа. И пример использования - causal Python.

P.S. см. также другие публикации, посвященные каузальности

Tuesday, December 14, 2021

Saturday, October 23, 2021

Causal Inference и Python

Визуализация каузальности - почему в графическом исполнении

Поиск причин - Causal discovery

см. также другие публикации, посвященные каузальности

Monday, July 13, 2020

Анализ причин

Вышедшая книга (два года назад мы писали о черновике) - Causal Inference

См. также другие публикации об анализе причин

Thursday, July 04, 2019

Каузалистика

Каузальные расчеты и их использование в Uber. Хорошая статья об определении связи явлений.

См. также другие публикации о причинности и вычислении causal impact

P.S. опубликовано при поддержке Инновационных решений в мире ИБП

Tuesday, December 25, 2018

И снова о причинах

Интересная книга (черновик) в открытом доступе: Causal Inference

Мы сравниваем (обычно только мысленно) результат при выполнении действия с результатом, когда действие не выполняется. Если два результата отличаются, мы говорим, что действие имеет причинный эффект (влияет, воздействует) на исход. В противном случае мы говорим, что действие не имеет причинного исхода. Эпидемиологи, статистики, экономисты и социологи действие часто называют вмешательством, воздействием или лечением.

Saturday, July 21, 2018

В чем причина?

Causal Impact анализ для мобильных приложений. В результате чего, в итоге, пользователям стало нравиться мобильное приложение. Вот здесь есть хорошее введение в Causal Impact анализ

см. также другие публикации, посвященные каузальности