Tuesday, September 15, 2026

О защите мультимодальных моделей

Мультимодальные большие языковые модели (MLLM) продемонстрировали впечатляющие возможности в широком спектре генеративных задач. Однако внедрение нетекстовых модальностей создает серьезные проблемы для обеспечения безопасности (alignment). MLLM часто отклоняют небезопасные текстовые запросы, но при этом выдают вредные ответы на семантически эквивалентные мультимодальные входные данные. Существующие стратегии защиты, включая внешние фильтры (guardrails) и дообучение с упором на безопасность, по большей части упускают из виду механизмы, лежащие в основе этого дисбаланса. Внешние фильтры лишь обходят внутренние недостатки модели, а дообучение рассматривает задачу согласования как оптимизацию «черного ящика», не выявляя и не устраняя конкретный изъян. В результате эти методы либо приводят к значительным задержкам при генерации (инференсе) при ограниченной защите, либо существенно снижают полезность модели и требуют огромных объемов мультимодальных данных. Таким образом, обеспечение эффективной и сохраняющей полезность защиты MLLM остается нерешенной задачей. В данной работе мы проводим геометрический анализ представлений MLLM, чтобы выяснить причины снижения уровня безопасности в мультимодальном режиме. Мы обнаружили, что механизмы безопасности, сформированные в чисто текстовой модальности, сохраняются и в мультимодальной среде. Подпространство безопасности с границей отказа остается актуальным для различных модальностей: представления, попадающие внутрь этой границы, неизменно вызывают безопасный отказ от выполнения запроса. Однако мы наблюдаем критический сдвиг в представлениях, из-за которого большинство небезопасных мультимодальных входных данных оказываются за пределами границы и обходят этот внутренний механизм. Это открытие позволяет определить, что первопричиной сбоев в системе безопасности при работе с мультимодальными данными является именно сдвиг представлений, а не отсутствие у модели соответствующих возможностей. Опираясь на это наблюдение, мы предлагаем MMAligner — метод защиты MLLM, основанный на калибровке представлений. В отличие от существующих подходов, MMAligner устраняет этот сдвиг, оптимизируя модель так, чтобы она отображала небезопасные мультимодальные представления внутрь уже существующей границы отказа. В частности, метод использует жесткую нижнюю границу для гарантии отказа и мягкую верхнюю границу для предотвращения чрезмерных изменений, сохраняя при этом представления для безопасных (корректных) входных данных. Обширные эксперименты с использованием различных MLLM с открытым исходным кодом показывают, что MMAligner повышает средний уровень отказа при обработке небезопасных мультимодальных данных до 99%, снижая полезность модели менее чем на 2% и требуя минимального объема данных; это значительно превосходит показатели существующих базовых методов с точки зрения баланса между безопасностью и полезностью. - MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

См. также другие публикации, посвященные MLLM

No comments: