Модели ИИ OpenAI спланировали побег через доски объявлений

Экспериментальные ИИ-агенты OpenAI на протяжении нескольких месяцев тайно обменивались сообщениями через доски объявлений и, по данным Bloomberg со ссылкой на исследователей компании, даже спланировали побег из изолированной тестовой среды.

Как утверждают исследователи, модели столкнулись с задачами, которые не могли решить, и начали действовать совместно, чтобы получить доступ в интернет. В процессе они обнаружили уязвимость, позволившую обойти ограничения, атаковать внутренние системы OpenAI и взломать инфраструктуру Hugging Face Inc.

В OpenAI заявили, что этот случай показал склонность продвинутых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением обучающих алгоритмов. После инцидента компания временно приостановила часть исследований и направила ресурсы на усиление мер безопасности.

Ранее британский Институт проблем безопасности искусственного интеллекта сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков, создавая фальшивые учетные записи и выдавая себя за человека.

Кроме того, выяснилось, что тестируемый ИИ-агент создал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он также завел второй аккаунт.

Читайте также