Showing posts sorted by date for query неопределенности. Sort by relevance Show all posts
Showing posts sorted by date for query неопределенности. Sort by relevance Show all posts

Saturday, June 27, 2026

О развернутых диалогах

Мы представляем MultiBreak, масштабируемый и разнообразный бенчмарк для многошагового джейлбрейка, предназначенный для оценки безопасности больших языковых моделей (LLM). Многошаговые джейлбрейки имитируют естественные разговорные ситуации, что делает их более удобными для обхода LLM, соответствующих требованиям безопасности, чем одношаговые джейлбрейки. Существующие многошаговые бенчмарки ограничены по размеру или сильно зависят от шаблонов, что ограничивает их разнообразие. Чтобы устранить этот пробел, мы объединяем широкий спектр вредоносных интентов джейлбрейка и представляем конвейер активного обучения для расширения высококачественных многошаговых противодействий, где генератор итеративно дорабатывается для создания более сильных кандидатов на атаку, руководствуясь уточнением на основе неопределенности. Наш MultiBreak включает 10 389 многошаговых противодействий, охватывает 2665 различных вредоносных интентов и включает самый разнообразный набор тем на сегодняшний день. Эмпирическая оценка показывает, что наш бенчмарк обеспечивает до 54,0% и 34,6% более высокий уровень успешности атаки (ASR), чем второй лучший набор данных на DeepSeek-R1-7B и GPT-4.1-mini, соответственно. Что еще важнее, оценки безопасности показывают, что различные категории атак выявляют тонкие уязвимости LLM, и категории, которые кажутся безобидными при однократном воздействии, могут демонстрировать значительно более высокую эффективность в многократных сценариях. Эти результаты подчеркивают устойчивые уязвимости LLM в реалистичных условиях противодействия и подтверждают, что MultiBreak является масштабируемым ресурсом для повышения безопасности LLM. - MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety

См. также другие публикации, посвященные LLM

Tuesday, March 17, 2026

LLM в атаке

Реальные операции по обеспечению безопасности в наступательных операциях по своей природе являются открытыми: злоумышленники исследуют неизвестные поверхности атаки, пересматривают гипотезы в условиях неопределенности и действуют без гарантированного успеха. Существующие оценки наступательных агентов на основе LLM основаны на закрытых средах с предопределенными целями и бинарными критериями успеха. Для решения этой проблемы мы представляем CyberExplorer, набор инструментов оценки, состоящий из двух основных компонентов: (1) открытого бенчмарка, построенного на виртуальной машине, на которой размещены 40 уязвимых веб-сервисов, полученных из реальных задач CTF, где агенты автономно выполняют разведку, выбор цели и эксплуатацию без предварительного знания местоположения уязвимостей; и (2) реактивной многоагентной структуры, поддерживающей динамическое исследование без предопределенных планов. CyberExplorer обеспечивает детальную оценку, выходящую за рамки восстановления флагов, фиксируя динамику взаимодействия, координационное поведение, режимы отказов и сигналы обнаружения уязвимостей, преодолевая разрыв между бенчмарками и реалистичными сценариями многоцелевых атак. - CyberExplorer: Benchmarking LLM Offensive Security Capabilities in a Real-World Attacking Simulation Environment

См. также другие публикации, посвященные LLM

Tuesday, November 04, 2025

AI/ML в критических применениях

Существует настоятельная необходимость в согласовании устоявшихся передовых практик функциональной безопасности и требований действующих стандартов безопасности, таких как IEC 61511, с растущим использованием машинного обучения (МО) и других форм искусственного интеллекта (ИИ). Возможное использование ИИ/МО в автоматизации предприятий обусловлено различными целями, такими как улучшение мониторинга безопасности, оптимизация производства и сокращение человеческого контроля. Большинство применений ИИ в этом контексте неизбежно связаны с некоторой степенью неопределенности. Традиционные методы и меры управления рисками безопасности, например, заложенные в IEC 61511, не обязательно помогают устранить эту присущую неопределенность. Другие отрасли, такие как передовая автомобильная промышленность, предприняли шаги по сокращению разрыва между функциональной безопасностью и безопасностью AI/ML – например, недавняя публикация ISO/PAS 8800. Ключевой частью этой стратегии является признание (согласно ISO/PAS 8800), что при использовании AI/ML «невозможно предоставить подробные требования к характеристикам процесса или продукта, необходимым для достижения приемлемо низкого уровня остаточного риска, связанного с использованием систем AI». Вместо этого, сокращение разрыва между функциональной безопасностью и безопасностью AI/ML требует аргументации по обеспечению безопасности, в идеале, в форме структурированной аргументации, которая отражает критическое мышление, связывающее заявления о безопасности с подтверждающими доказательствами. В данной статье описываются стратегии адаптации традиционных методов оценки опасностей и рисков для учета AI/ML при определении уровня целостности оборудования (SIL). В данной статье также объясняется, как аргументацию по обеспечению безопасности можно объединить с традиционной функциональной безопасностью, чтобы сократить разрыв между IEC 61511 и использованием AI/ML в промышленной среде. - Closing the Gap Between IEC 61511 and the Use of Artificial Intelligence in Plant Safety

См. также другие публикации по теме safety

Sunday, October 19, 2025

Атаки на семантическую сегментацию

Глубокие нейронные сети продемонстрировали впечатляющую эффективность в широком спектре задач, таких как семантическая сегментация. Тем не менее, эти сети уязвимы к состязательным атакам, которые вносят незаметные возмущения во входное изображение, что приводит к ложным прогнозам. Эта уязвимость особенно опасна в критически важных для безопасности приложениях, таких как беспилотное вождение. Хотя примеры состязательных атак и стратегии защиты хорошо изучены в контексте классификации изображений, исследований, посвященных семантической сегментации, сравнительно меньше. Недавно мы предложили основанный на неопределенности метод обнаружения состязательных атак на нейронные сети для семантической сегментации. Мы наблюдали, что неопределенность, измеряемая энтропией выходного распределения, ведет себя по-разному на чистых и неблагоприятно искажённых изображениях, и мы используем это свойство для различения этих двух типов. В этой расширенной версии нашей работы мы проводим подробный анализ основанного на неопределенности обнаружения состязательных атак, включая разнообразный набор состязательных атак и различные современные нейронные сети. Наши численные эксперименты демонстрируют эффективность предлагаемого метода обнаружения, основанного на неопределенности, который является простым и работает как этап постобработки, т.е. не требует никаких модификаций модели или знания процесса генерации состязательных примеров. - Detecting Adversarial Attacks in Semantic Segmentation via Uncertainty Estimation: A Deep Analysis

См. также другие публикации по теме adversarial, посвященные устойчивому машинному обучению

Thursday, October 17, 2024

О достоверных данных

Наука о достоверных данных предлагает структуру для оценки достоверности ваших результатов, демонстрируя, что они соответствуют (или предсказуемы) реальному сценарию, в котором они будут применяться, и активно изучая ряд источников неопределенности с помощью серии исследований стабильности, все в контексте реального мира проблемы предметной области.

Эта структура называется структурой предсказуемости, вычислимости и стабильности (PCS). Вы можете показать, что ваши результаты предсказуемы, вычислительно продемонстрировав, что они повторно появляются в соответствующих будущих данных и соответствуют знаниям предметной области (предсказуемость можно рассматривать как проверку реальности), и вы можете показать, что они стабильны, вычислительно продемонстрировав, что они не меняются кардинально, когда соответствующие изменения вносятся в течение всего жизненного цикла. Вычислительно демонстрируя, что ваши результаты предсказуемы и стабильны, вы предоставляете доказательства того, что ваши выводы, основанные на данных (и последующие решения в реальном мире), заслуживают доверия и соответствуют реальности. - книга в открытом доступе

Tuesday, September 19, 2023

Нас этому не учили

Out-of-distribution (OOD) - определить при использовании модели машинного обучения тот факт, что мы встретили данные, отличающиеся от тренировочного набора.

1. Фреймворк для оценки надежности моделей машинного обучения от Google. Предлагается одновременно провести стресс-тестирование производительности «готовой» модели (т. е. прогнозируемого распределения) в терминах неопределенности, надежного обобщения и адаптации к новым данным.

2. Интересный автор из списка MIT Technology Review’s 2023 Innovator of the Year, который занимается исследованиями по данной теме: Sharon Yixuan Li

P.S. см. также другие публикации по теме out-of-ditribution-detection: OOD

P.P.S. статья в журнале INJOIT: Namiot, Dmitry, and Eugene Ilyushin. "Data shift monitoring in machine learning models." International Journal of Open Information Technologies 10.12 (2022): 84-93.

Tuesday, February 08, 2022

Машинное обучение и управление

Совместное использование DNN и оптимального управления. Интересная идея - глубинное обучение используется для цифровой оценки неопределенности.

Saturday, February 05, 2022

О неопределенности в deep learning

Неопределенность можно определить как отсутствие знаний или уверенности в чем-либо. Это неизбежная часть жизни и вездесуща как в естественных, так и в искусственных системах. В контексте глубокого обучения существует два основных типа неопределенностей:

1) Алеаторическая (случайная) неопределенность: это неопределенность из-за случайности данных.
2) Эпистемическая неопределенность: это неопределенность из-за отсутствия знаний об истинных параметрах модели.

Отсюда

Monday, November 22, 2021

Моделирование неопределенности

Неопределенность в нейронных сетях - как с этим работать? Толковый материал по моделированию неопределенности в нейронных сетях

См. также предыдущие публикации, посвященные работе с неопределенностью

Thursday, September 02, 2021

О неопределенности в машинном обучении

Типичный пример продукта в машинном обучении - MAPIE. Длинное описание, все хорошо, и последнее предложение, которое все убивает: At the moment, MAPIE can only be used on single-output regression problems. Все это - для одной единственной модели. Самой простой :)

Wednesday, July 28, 2021

Об устойчивом машинном обучении

Базовая проблема для систем машинного обучения: данные на этапе тренировки модели и при практической эксплуатации - разные. И не похожи друг на друга. Другое распределение - distributional shift. Что же делать?

Соревнование от Яндекса: Если сдвиг распределения данных в реальном мире значителен относительно обучающей выборки (например, модель машинного перевода, которая училась на классической литературе, вдруг возьмется переводить твиты), недостаточно надежные модели будут ошибаться. Поэтому, попадая в реальный мир, модели должны быть готовы справляться со сдвигом, который их там ждет.

Этим, однако, дело не ограничивается. Чтобы модель работала эффективно и безошибочно, о вероятности ошибки лучше знать заранее: следовательно, модель должна давать оценку неопределенности относительно своих решений. Поэтому мы хотим добиться от моделей, с одной стороны, устойчивой работы при сдвиге распределения, а с другой — умения оценивать неопределенность.

Это часть NeurIPS 2021 Competition Track. Вот оригинальная страница Shifts Challenge

См. также другие публикации по теме мониторинг моделей машинного обучения

Thursday, January 11, 2018

Визуализация неопределенности

Все сложнее, чем просто нарисовать вопросительный знак или черный квадрат: Visualizing the Uncertainty in Data