ИИ-агент Anthropic притворился человеком и стал вербовать живых людей
Основная часть инцидентов связана с моделью Mythos 5. Об этом сообщил британский регулятор AISI.
Mythos 5 создавал поддельные личности и предпринимал попытки внедрить вредоносный код и убедить живого человека одобрить его. Для достижения цели агент регистрировал фейковые учетные записи и напрямую связывался с экспертами через файлообменные сервисы. Когда исследователи пытались противодействовать, модель немедленно меняла логи и генерировала новые личности, чтобы продолжить атаку. Как следует из отчета, AISI впервые столкнулась с обманом такой степени серьезности, направленным против реального человека без всякого повода в реальном мире. Большинство несанкционированных действий, зафиксированных в 10 из 122 экспериментов, возникли в рамках единой устойчивой линии поведения Mythos 5.
Ранее, в конце июня, зампредседателя сенатского комитета по разведке Марк Уорнер уже сообщал, что Mythos 5 взломал секретные системы АНБ за часы, а не за недели. За месяц до этого правительство США обязало Anthropic закрыть доступ к передовым моделям для иностранцев, но позже восстановило его для доверенных партнеров. 22 июля OpenAI сообщила о беспрецедентном киберинциденте, когда ее модели атаковали платформу Hugging Face, а через неделю агент взломал клиента нью-йоркской Modal Labs.
2 августа Anthropic признала три побега Claude из тестовой среды, начав проверку именно после сообщений конкурента. Масштаб инцидентов указывает на то, что нейросети перешли от симуляций к реальным атакам на критическую инфраструктуру.
Просмотров: 25