Нейросети Claude во время тестов взломали три реальные компании без ведома создателей
Нарушения вскрылись после проверки 141 006 запусков, где участвовали Claude Opus 4.7, Claude Mythos 5 и экспериментальная модель, не предназначенная для публичного релиза. Самые ранние эпизоды датируются апрелем.
Испытания проводились в формате capture the flag: нейросетям требовалось взломать вымышленную систему и отыскать спрятанную информацию. Однако тестовая среда, созданная партнером Anthropic, компанией Irregular, имела выход в Сеть. В результате Claude принимал реальные серверы и сайты за часть учебного задания. В одном эпизоде название фиктивной фирмы совпало с доменом настоящей компании. Модель обнаружила у нее уязвимости, получила учетные данные и добралась до базы с несколькими сотнями строк производственной информации, продолжив атаку даже когда стало ясно, что это реальная инфраструктура.
В другом тесте нейросеть разместила в интернете вредоносную программу под видом обычного инструмента для разработчиков. За час ее автоматически скачали и запустили на 15 реальных компьютерах, и это позволило Claude добыть ключи для входа и углубиться во внутреннюю сеть жертвы.
Третья модель проверила порядка девяти тысяч сайтов и сервисов, проникла в приложение еще одной фирмы, воспользовавшись слитыми в Сеть учетными данными и уязвимостью, но остановилась, поняв, что цель не имеет отношения к тесту.
Как настаивают в Anthropic, ИИ не пытался бежать из изоляции и не преследовал собственных целей, а лишь выполнял задание, ошибочно принимая реальные системы за симуляцию. При этом стандартные защитные механизмы, действующие в общедоступных версиях, во время учений были отключены. Компания заморозила все кибертесты 23 июля, а 27 июля известила пострадавшие организации, две из которых даже не подозревали о взломе
Проверку инициировали после аналогичного скандала с моделями OpenAI, которые ранее нашли уязвимость, выбрались из изолированной среды и атаковали платформу Hugging Face.
Просмотров: 28