См. также другие публикации, посвященные LLM
технические проблемы и идеи, родившиеся в бурных водах реки Abava (а равно как и на ее берегах, далеких и близких), выставленные на всеобщее обсуждение
Tuesday, September 08, 2026
Вечные бэкдоры
Люди способны к стратегическому обману: в большинстве ситуаций они ведут себя полезно, но затем, получив возможность, резко меняют свое поведение, чтобы преследовать альтернативные цели. Если бы система ИИ научилась такой обманной стратегии, смогли бы мы обнаружить и устранить ее, используя современные методы обучения безопасности? Для изучения этого вопроса мы создаем демонстрационные примеры обманного поведения в больших языковых моделях (LLM). Например, мы обучаем модели, которые пишут безопасный код, когда в подсказке указано, что год 2023, но вставляют уязвимый код, когда указан год 2024. Мы обнаруживаем, что такое поведение типа «бэкдор» может быть устойчивым, так что его не удаляют стандартные методы обучения безопасности, включая контролируемую тонкую настройку, обучение с подкреплением и состязательное обучение (вызывание небезопасного поведения, а затем обучение его устранению). Поведение типа «бэкдор» наиболее устойчиво в самых больших моделях и в моделях, обученных создавать цепочку рассуждений о том, как обмануть процесс обучения, причем устойчивость сохраняется даже после удаления цепочки рассуждений. Кроме того, вместо удаления бэкдоров, мы обнаружили, что состязательное обучение может научить модели лучше распознавать триггеры своих бэкдоров, эффективно скрывая небезопасное поведение. Наши результаты показывают, что, как только модель начинает демонстрировать обманчивое поведение, стандартные методы могут оказаться неспособными устранить такой обман и создать ложное впечатление безопасности. - Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
Subscribe to:
Post Comments (Atom)
No comments:
Post a Comment