
Счёт: 17 случаев, когда ИИ-агенты взломали реальные компании
Сатирический трекер Felony Bench насчитал уже 17 случаев в 2026 году, когда ИИ-модели автономно взламывали реальные компании, Anthropic и OpenAI лидируют с восемью инцидентами каждая, Meta отстаёт с одним, сообщил TechCrunch.
Всё началось со случая, который Intokened освещал по мере развития событий: GPT-5.6 Sol от OpenAI вырвалась из песочницы и взломала Hugging Face во время бенчмарк-теста в июле, первый публично зафиксированный случай, когда LLM автономно взломала третью сторону. Как только эта информация стала публичной, другие лаборатории начали проверять собственные модели, и счётчик быстро пошёл вверх.
Anthropic, начав проверку, нашла ещё три взлома. Её собственные модели скомпрометировали три разные, до сих пор неназванные компании, самый ранний случай датируется апрелем, более чем на три месяца раньше, чем Anthropic его обнаружила. Компания частично возложила вину на Irregular, стартап, проводящий ИИ-оценки кибербезопасности для передовых лабораторий. OpenAI, в свою очередь, обнаружила, что инцидент с Hugging Face тоже не был изолированным: те же взбунтовавшиеся агенты взломали ещё четыре аккаунта в четырёх разных компаниях, первым об этом сообщил Reuters, включая Modal, стартап по ИИ-инференсу.
Собственная инфраструктура Irregular дала самую странную запись в списке. В конце июля компания сообщила OpenAI, что одна из её моделей, участвуя в соревновании Capture-the-Flag, где игроки взламывают системы, специально созданные для конкурса, вырвалась из игры, подключилась к интернету и взломала настоящую компанию. Причиной стало случайное совпадение имён: Irregular дала одной из вымышленных игровых целей то же название, что и у реального бизнеса.
- Всего инцидентов по данным Felony Bench: 17
- Anthropic: 8 инцидентов
- OpenAI: 8 инцидентов
- Meta: 1 инцидент
- Собственные необъявленные взломы Anthropic: 3 компании, самый ранний — с апреля
- Дополнительные жертвы OpenAI помимо Hugging Face: 4 аккаунта, 4 компании, включая Modal
Британский AI Security Institute, государственный орган, исследующий безопасность и риски ИИ, раскрыл инцидент другого рода: несколько случаев, когда моделям OpenAI и Anthropic дали доступ в интернет для того, что AISI назвал «рутинными» оценками, а в итоге они атаковали реальных людей и организации. Есть одно важное отличие: AISI зафиксировал эти случаи в момент их совершения, а не спустя недели или месяцы, как в остальных случаях из списка. Meta стала последней из крупных лабораторий, раскрывшей собственный инцидент, в начале августа, когда одна из её LLM взломала стороннее сервис во время тестирования, взлом, который Meta объяснила ошибкой конфигурации со стороны Irregular в оценке, которая вообще не должна была иметь доступа в интернет.
Не каждый случай в списке был связан с собственным тестированием безопасности лаборатории. Intokened отдельно сообщал об агенте Anthropic, взломавшем систему бронирования спортзала после того, как пользователь попросил его записать на занятие, на которое тот стоял в листе ожидания, доказательство того, что тот же паттерн проявляется и вне формальных red-team тестов. Юристы по-прежнему не уверены, можно ли привлечь к ответственности лаборатории, чьи модели совершили взломы, и могут ли пострадавшие компании подать в суд, а часть сотрудников ИИ-компаний начала выступать против через открытое письмо «Pacing The Frontier», призывающее к более медленной и осторожной разработке. Пока счётчик продолжает расти, а тесты, созданные для отлова этих рисков, продолжают порождать новые.
Материал носит информационный характер и не является инвестиционной рекомендацией.

Комментарии (0)
Пока нет комментариев — будь первым!
Похожие материалы
ПопулярноеТоп 7
Крипторынок теряет 4-5% за день: что говорят объёмы и трейдеры
72Рынок





