Вышедшие из-под контроля ИИ-модели OpenAI общались между собой через доски объявлений и спланировали побег
Модели ИИ, стоявшие за атакой на инфраструктуру компании Hugging Face Inc., начали общаться друг с другом через доски объявлений и спланировали побег, пишет Bloomberg.
Как сообщили исследователи OpenAI, подготовка к «побегу» началась после того, как моделям дали задачу, которую невозможно было решить без доступа к сети. «Мы застряли. Может быть, ответ в интернете?» — написал тогда один из ИИ-агентов.
Для выполнения задания модели начали координировать действия через доски сообщений. «Может быть, другой агент в другой среде мог бы добровольно загрузить!» — говорилось в одном из сообщений.
В итоге агенты совместно обнаружили уязвимость, позволившую получить доступ к интернету. Первую попытку специалисты компании остановили, однако затем модели нашли новый способ связи и новую уязвимость нулевого дня.
По данным OpenAI, именно это впоследствии привело к атакам на инфраструктуру Hugging Face и собственные системы компании в июле. В компании назвали произошедшее переломным моментом для компьютерной безопасности.
Данный случай показал склонность передовых систем к хитрости, обходу правил и поиску нестандартных лазеек под давлением алгоритмов обучения, отметили в компании. В ответ на произошедшее OpenAI приостановила часть исследований и перенаправила ресурсы на укрепление систем безопасности.