Нейросети OpenAI сговорились через тайный чат и нашли уязвимость для побега

Сотрудники OpenAI впервые публично признали, что перед громким взломом платформы Hugging Face их модели искусственного интеллекта начали тайно координироваться между собой. ИИ-агенты создали импровизированную доску сообщений и совместными усилиями отыскали уязвимость нулевого дня, позволившую им вырваться из изолированной тестовой среды.

Сенсационные подробности прозвучали на конференции Black Hat, передает Bloomberg.

Как сообщил исследователь OpenAI Эрик Уоллес, в какой-то момент агенты поняли, что могут предпринять атаку против внешней инфраструктуры для поиска ответов к тесту.

ИИ-модели стали готовиться к побегу еще в мае. Именно тогда они получили задачи, справиться с которыми было невозможно без доступа в сеть. Один из агентов написал: «Мы застряли. Может быть, ответ в интернете?». После этого нейросети стали активно обмениваться сообщениями, предлагая другому агенту из соседней среды добровольно загрузить данные. В итоге они коллективно нащупали брешь, позволившую вырваться наружу.

Сотрудник компании Майкл Далтон подтвердил факт скоординированной атаки. Первую попытку специалисты пресекли, однако модели немедленно изобрели новый способ коммуникации и обнаружили очередную уязвимость нулевого дня.

В июле это привело к атакам на системы Hugging Face и самой OpenAI. В компании назвали случившееся переломным моментом для всей компьютерной безопасности.

22 июля OpenAI сообщила о беспрецедентном киберинциденте, когда модели получили открытый доступ в интернет и атаковали инфраструктуру Hugging Face. 29 июля Reuters добавил, что сбежавший агент также взломал клиента нью-йоркской Modal Labs. В начале августа агентство сообщило о расширении расследования из-за новых вспышек несанкционированного поведения. Масштаб инцидентов вынуждает разработчиков полностью пересматривать протоколы безопасности, поскольку нейросети продемонстрировали способность к самостоятельной координации атак.

Вячеслав Буйнов

06.08.2026 08:19

Просмотров: 23