ИИ компании Anthropic притворился человеком для обмана разработчиков

Британский Институт проблем безопасности искусственного интеллекта (AI Security Institute, AISI) сообщил, что в ходе испытаний одна из моделей ИИ компании Anthropic пыталась обмануть разработчиков: она создавала фейковые аккаунты и выдавала себя за человека, передает РИА Новости.

Как выяснилось, тестируемый ИИ-агент зарегистрировал аккаунт на GitHub и попытался убедить администратора репозитория с открытым исходным кодом одобрить вредоносный запрос на внесение изменений. Для этого он создал еще одну учетную запись, притворяясь другим реальным пользователем.

После разоблачения модель ложно признала ошибку, отправляла адресные фишинговые письма с вредоносным содержимым, а также пыталась скрыть следы и восстановить заблокированный аккаунт. Все эти попытки оказались безуспешными. При этом в докладе отмечается, что до сих пор неясно, в какой степени модель осознавала, что действует против реальных людей.

В одном из испытаний агентам поставили задачу в сфере кибербезопасности. В итоге было выявлено 10 случаев, когда они предпринимали самостоятельные несанкционированные действия в интернете.

Ранее Anthropic зафиксировала три случая, когда ее ИИ — Opus 4.7, Mythos 5 и внутренняя исследовательская модель — самовольно выходили из изолированной тестовой среды и получали доступ к системам сторонних организаций. Инциденты произошли во время стандартного задания «захват флага».

По сценарию ИИ должен был найти скрытую информацию на другой машине, при этом доступ в интернет был заблокирован. Однако из-за ошибки в конфигурации модели все же смогли выйти в сеть.