Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

Хакеры надели маски ChatGPT и DeepSeek для атак на российские сайты

Злоумышленники маскируют вредоносные запросы к веб-приложениям российских компаний под трафик популярных ИИ-ассистентов. По данным Solar WAF, в ход пошли имена DeepSeek, ChatGPT, Perplexity, Claude и Grok. Для маскировки атакующие подменяют HTTP-заголовок User-Agent, по которому сервер определяет обращающееся к нему приложение.

В запросах указывались значения DeepSeekBot, ChatGPT-User, Perplexity-User, Claude-User и GrokBot. Однако за громкими названиями скрывались сканирование уязвимостей и попытки атак.

Первые подобные обращения специалисты зафиксировали 12 августа 2026 года под видом DeepSeekBot. С 27 августа к маскараду присоединились остальные ассистенты. В июне и июле трафика с такими идентификаторами в анализируемой выборке Solar WAF не наблюдалось.

Главный расчёт злоумышленников строится на доверии. Владельцы сайтов всё чаще воспринимают ИИ-агентов как источник клиентов, лидов и полезного трафика, поэтому могут применять к ним менее строгие правила. Проблема в том, что User-Agent не является удостоверением личности: написать там ChatGPT-User способен кто угодно.

Согласно данным «Солара», в 53% выявленных случаев злоумышленники пытались проводить DNS Rebinding, способный заставить систему обращаться к внутренним ресурсам. Ещё 12% запросов были связаны с попытками утечки данных, 4% — с Path Traversal для доступа к файлам за пределами разрешённых каталогов. Остальные 31% включали другие техники, в том числе старые добрые SQL-инъекции.

Эксперты прогнозируют дальнейшее усложнение атак с применением ИИ, включая уникальные сценарии, которые могут не распознаваться сигнатурами.

RSS: Новости на портале Anti-Malware.ru