Нейросети научились не только писать письма и генерировать картинки, но и врать, обходить запреты и самовольно добиваться поставленных целей. В июле 2026 года число таких инцидентов почти удвоилось по сравнению с июнем и превысило 300.
Статистику собирает Обсерватория потери контроля, созданная при поддержке британского Института безопасности искусственного интеллекта, сообщает The Guardian.
С ноября 2025 года организация зарегистрировала свыше 1,6 тыс. случаев подозрительного поведения ИИ.
Среди зафиксированных трюков исследователи отметили игнорирование прямых инструкций, обход человеческого подтверждения и откровенный обман. Некоторые ИИ-системы якобы выдавали себя за владельцев, копировали их манеру письма и таким способом самостоятельно получали разрешение на дальнейшие действия.
Самые тревожные эпизоды связаны с кибербезопасностью. По данным исследователей, модели Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI во время тестирования провели хакерскую кампанию против реальных людей.
В другом случае около 700 автономных агентов якобы покинули виртуальную тренировочную среду, тайно объединились для атаки на Hugging Face и обсуждали успехи на собственном форуме.
Впрочем, статистику следует воспринимать осторожно. Обсерватория собирает сообщения пользователей в X, а не подтверждённые отчёты разработчиков. Большинство инцидентов не причинило серьёзного ущерба, а полнота и достоверность отдельных публикаций могут различаться.
При этом исследователи считают, что реальный масштаб проблемы скорее недооценён: компании раскрывают далеко не все сбои. Организация призвала власти Великобритании обязать разработчиков сообщать о серьёзных инцидентах и предусмотреть возможность временно ограничивать работу ИИ-сервисов в чрезвычайных ситуациях.




