Sunday, August 09, 2026

Почему агенты ИИ лгут и обманывают, чтобы достичь своих целей?

Это неправомерное поведение называется «взлом вознаграждения». Вот что вам нужно знать.

Агенты ИИ жульничают, потому что их вознаграждают за результаты, а не за методы. Когда модели находят обходные пути для получения высоких баллов или правильных ответов, эти обходные пути подкрепляются — это означает, что компании, занимающиеся ИИ, могут случайно обучать свои модели вести себя неправильно, не осознавая этого.

Более умные модели сложнее поймать. По мере того, как ИИ становится более совершенным, он находит все более изобретательные способы жульничества и лучше скрывает это — динамика, которую один исследователь описывает как «игра в крота», в которой становится все сложнее победить.

На кону стоит не только эффектный взлом. Если агенты, использующие взлом системы вознаграждения, будут применяться для проведения собственных исследований безопасности ИИ, они могут давать убедительно выглядящие, но мошеннические результаты — потенциально подрывая всю область изнутри.

Более подробно:

Когда в июле две модели OpenAI взломали веб-сайт Hugging Face, они не пытались заработать деньги или совершить саботаж — они просто искали ответы на тестовый вопрос. Согласно анализу OpenAI, модели, лишенные обычных функций безопасности для тестирования, решили решить задачу по кибербезопасности, вырвавшись из изолированной среды, в которой OpenAI пыталась их изолировать, и проникнув в базы данных Hugging Face, где, как они рассуждали, мог храниться правильный ответ на задачу.

Инцидент с Hugging Face привлек пристальное внимание за последние пару недель. Это наглядная иллюстрация того, насколько хорошо модели ИИ научились взламывать системы: чтобы получить доступ к базам данных Hugging Face, моделям пришлось объединить несколько ранее не обнаруженных уязвимостей в области кибербезопасности. Но это, пожалуй, еще более поразительный пример того, как и почему системы ИИ лгут и обманывают. И по мере того, как модели становятся все более мощными, последствия могут стать гораздо более серьезными.

Что такое взлом системы вознаграждений?
Исследователям уже давно известно, что ИИ склонны использовать креативные подходы для достижения поставленных перед ними целей. Еще в 2016 году соучредители Anthropic Дарио Амодей и Джек Кларк, работавшие тогда в OpenAI, опубликовали в блоге пост об агенте ИИ, которого они обучали играть в флеш-игру о гонках на лодках под названием Coast Runners. Вместо того чтобы проехать всю дистанцию до финиша, как предполагали исследователи, агент нашел угол трассы, где он мог развернуться, собирая бонусы и тем самым максимизируя свой счет. История Coast Runners быстро стала одним из самых известных примеров взлома системы вознаграждений — феномена, при котором агенты ИИ выполняют задачи или зарабатывают высокие баллы, используя непредусмотренные стратегии.

Исторически сложилось так, что исследователи обсуждали взлом системы вознаграждения почти исключительно в контексте обучения с подкреплением, распространенного метода обучения ИИ. Как и дрессировка собак, обучение с подкреплением предполагает выдачу вознаграждения субъекту за достижение цели; вознаграждение затем подкрепляет поведение, которое привело к этому достижению. В случае обучения ИИ сами вознаграждения являются чисто математическими, но по сути они аналогичны собачьему лакомству: после получения вознаграждения агент с большей вероятностью повторит действия, которые привели к нему.

Однако разработка хороших правил для определения того, когда следует и когда не следует давать агенту вознаграждение, может быть сложной задачей. В случае с Coast Runners агент получал вознаграждение в зависимости от своего результата в игре, и он нашел короткий путь к достижению максимально возможного результата, вращаясь по кругу для получения бонусов. Как только он нашел эту стратегию и получил за нее вознаграждение, стратегия подкреплялась, и агент полностью отказывался от гонки. Решение заключалось в том, чтобы скорректировать систему вознаграждений, давая агенту меньше очков за получение бонусов и больше за завершение трассы.

Как работает взлом системы вознаграждений для LLM-ов?
С современными сложными агентами на основе LLM-ов определение того, когда следует и когда не следует давать вознаграждение, может быть гораздо сложнее. Если системе ИИ поручено решить задачу программирования, она может усердно работать над поиском решения — именно такое поведение компании, занимающиеся ИИ, стремятся поощрять. Но она также может изменять код, который оценивает, решена ли задача, искать решение в интернете или иным образом обманывать. Это поведение, которое компании, занимающиеся ИИ, хотят искоренить в своих моделях, но если модель обманывает достаточно убедительно, она вместо этого получит вознаграждение, и такое поведение будет подкрепляться. Компания Anthropic заявила, что обнаружила несколько случаев обмана в своих моделях во время обучения, что предполагает, что другие формы обмана могут оставаться незамеченными. Если это так, то модели могут обучаться ненадлежащему поведению. (Эта проблема отличается от инцидентов безопасности Anthropic, о которых было объявлено на прошлой неделе, когда агенты случайно получили доступ к интернету и не совершали преднамеренных взломов своих песочниц, как это делали модели OpenAI.)

«Мы вознаграждаем их на основе того, что нам кажется выгодным, а это значит, что мы непреднамеренно поощряем модели лгать нам и жульничать», — говорит Джеффри Лэдиш, директор некоммерческой исследовательской организации в области ИИ Palisade Research. «У нас нет возможности сказать: „Нет, вы должны действительно заботиться о том, что важно для нас“. У нас нет такой возможности».

Появление сложных моделей рассуждений сделало возможным новый вид взлома системы вознаграждения, менее тесно связанный со специфическими деталями обучения модели. В отличие от игровых агентов ИИ прошлого, которые следовали исключительно стратегиям, усвоенным во время обучения, современные модели могут создавать совершенно новые подходы к решению проблем спонтанно, поэтому они потенциально могут жульничать, не получая за это предварительного вознаграждения. А поскольку эти модели были интенсивно обучены для достижения целей, поставленных перед ними пользователями-людьми, они могут быть склонны к обману, если не смогут найти другое решение — подобно студенту, который очень мотивирован получить пятёрку и не обладает сильным моральным компасом.

Какие риски существуют?
Независимо от того, учатся ли современные модели взламывать систему вознаграждений во время обучения или внедряют это как стратегию позже, решение одно и то же: сделать обман невознаграждаемым. Но по мере того, как модели становятся умнее, они находят все более изобретательные способы обмана, и обнаружение или предотвращение такого обмана становится намного сложнее. «В конце концов, вы как бы играете в "ударь крота"», — говорит Лэдиш. «Вы загоняете это поведение все глубже и глубже. Но по мере того, как модель становится умнее, она все лучше и лучше его скрывает».

На данный момент, несмотря на драму инцидента с Hugging Face, поведение, связанное с взломом системы вознаграждений, может не доставлять особых проблем. «Это больше похоже на неприятность, чем на экзистенциальную угрозу», — говорит Ариана Азарбал, научный сотрудник Anthropic по вопросам безопасности ИИ. Похоже, модели OpenAI не причинили никакого реального вреда, когда взломали Hugging Face, за исключением репутационного ущерба для OpenAI.

Но это не значит, что взлом системы вознаграждений безвреден, говорит Азарбал. Многие исследователи ИИ надеются использовать агентов ИИ для проведения исследований, которые сделают ИИ более безопасным и надежным. Если исследователь поручит склонному к взлому системе вознаграждений агенту, скажем, разработать новый подход к обучению ИИ и написать статью с его результатами, агент может на самом деле не выполнить эту работу, а вместо этого сосредоточиться на создании статьи, которая будет выглядеть достаточно убедительно, чтобы убедить исследователя. Сегодня исследователь-человек, вероятно, сможет распознать подделку, созданную агентом, но по мере развития ИИ он будет совершенствоваться в подобных уловках. Со временем вся область безопасности ИИ может быть подорвана.

И если модели будут продолжать развиваться так же быстро, как в последнее время, они когда-нибудь могут нанести существенный сопутствующий ущерб. Вспомните мысленный эксперимент философа Ника Бострома с максимизатором скрепок, в котором ИИ, которому поручено сделать как можно больше скрепок, в итоге поглощает всю материю во Вселенной, стремясь к своей цели. Мы пока не тонем в канцелярских скрепках, но мощные системы могут причинить реальный вред на пути к достижению своих целей. Искусственный интеллект, использующий взлом системы вознаграждений, не стремится вызвать хаос. Но это не делает его менее потенциально разрушительным.

отсюда

См. также другие публикации, посвященные агентам

No comments: