Saturday, August 22, 2026

И снова о безопасности ИИ

Растет количество организаций, занятых исключительно такой тематикой. Вот еще одна новая компания.

"Guidelight — это новая независимая некоммерческая организация, основанная Пейдж Хедли и Стивеном Адлером (оба — бывшие руководители OpenAI по вопросам безопасности), которая сотрудничает с независимыми экспертами, компаниями, занимающимися ИИ, и общественностью для определения важных методов обеспечения безопасности и содействия их внедрению.

В настоящее время компании, работающие в сфере ИИ, недостаточно инвестируют в безопасность, опасаясь отстать от менее осторожных конкурентов. Наша стратегия заключается в устранении этих стимулов и сосредоточении усилий компаний на наиболее важных методах обеспечения безопасности.

У нас есть три взаимодополняющие программы:

1.Стандарты
Мы сочетаем принципы безопасности с конкретными практическими методами, которые их реализуют, синтезируя существующие исследования, мнения экспертов и наш собственный опыт.

2. Оценки
Мы оцениваем текущие методы работы компаний в соответствии с этими стандартами и публикуем результаты, опираясь на общедоступную информацию, достоверные отчеты и заявления компаний.

3. Стимулирование

Мы стимулируем внедрение компаниями более безопасных методов работы, поддерживая сотрудников, заботящихся о безопасности, внутри компании и создавая конкурентное давление со стороны клиентов, инвесторов и общественности.

Для того чтобы решения компаний в области безопасности учитывались общественные интересы, необходима независимость от этих компаний. Guidelight не принимает финансирование от компаний, занимающихся искусственным интеллектом, или от их сотрудников.

Наша цель — коммерческая среда, где безопасность выгодна, где интересы компаний, занимающихся искусственным интеллектом, и общественности совпадают."

И вот их интересный отчет AI Control: An Assessment of Frontier Practices. Согласно своему стандарту были оценены разработки пяти лидирующих компаний: Anthropic, OpenAI, Google, xAI, Meta.

Оценивались 6 практик:

  • Ведение журналов: регистрируйте действия внутренних ИИ для последующего мониторинга.
  • Мониторинг эффективности: измеряйте эффективность мониторинга.
  • Ограниченные действия: требуйте от наблюдателя подтверждения безопасности определенных действий ИИ с высоким риском, прежде чем они вступят в силу.
  • Предотвращение сбоев: временно останавливайте системы ИИ после всплеска выявленного некорректного поведения.
  • Независимая экспертиза: привлекайте сторонних специалистов для оценки адекватности мер контроля.
  • План сдерживания: разработайте план сдерживания некорректно работающей модели.

См. также другие публикации по теме аудит

No comments: