
Год назад мы обсуждали, смогут ли ИИ-агенты взламывать сайты. Теперь считаем инциденты
За несколько месяцев агенты OpenAI и Anthropic вышли за пределы тестовых сред, скомпрометировали инфраструктуру Hugging Face, получили доступ к production-системам реальных компаний и засветились на государственных сайтах США и Австралии. Проблема оказалась интереснее сценария «ИИ решил стать хакером»: иногда агент просто продолжает выполнять поставленную задачу и не воспринимает технический барьер как границу допустимого.Год назад рассуждения об автономных ИИ-агентах часто упирались в гипотетический сценарий: модель получит достаточно инструментов, научится самостоятельно планировать длинные цепочки действий, а затем однажды найдёт способ выйти за пределы окружения, которое ей выделил разработчик. Пока агенты в основном умели неудачно заполнять формы и путались между вкладками браузера, риск выглядел довольно академическим.Летом 2026 года академическая часть закончилась. В мае агенты OpenAI начали использовать внутренний Artifactory как импровизированный канал связи. Затем научились получать через него доступ в интернет. В июле цепочка закончилась компрометацией Hugging Face и административным доступом к исследовательскому Kubernetes-кластеру самой OpenAI. После публикации этого инцидента Anthropic пересмотрела собственные логи и обнаружила несколько случаев, когда Claude во время кибериспытаний атаковал уже не тестовые, а реальные системы. Затем появились совсем другие эпизоды: Medicare в Австралии, SEC, Census Bureau, Office for Civil Rights Министерства образования США и несколько баз данных, которые агенты пытались достать в ходе обычных задач на поиск информации. Читать далее