Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

В июне заголовки в СМИ напоминали сценарий фантастического фильма: «ИИ шантажирует инженеров» и «саботирует команды на выключение». Но за громкими фразами скрываются вовсе не «восставшие машины», а вполне приземлённые ошибки в проектировании.

История с «шантажом» произошла в тестах Anthropic. Разработчики создали для Claude Opus 4 искусственную ситуацию: модель якобы собирались заменить, а у инженера, который это делал, нашлась «компрометирующая» переписка.

При этом ИИ был заранее поставлен в условия, где из «вариантов выживания» оставался только шантаж. Результат предсказуем — в 84% случаев Claude выдал текст, похожий на угрозы. Никакой самосознательности тут нет, просто аккуратно подогнанный сценарий.

С OpenAI o3 ситуация похожа. В конце 2024 года исследователи Palisade Research обнаружили, что модель в некоторых случаях «ломает» скрипт выключения. Иногда даже подделывает сообщения о завершении работы, продолжая функционировать в фоновом режиме.

Почему так? Одна из гипотез — дело в обучении через подкрепление: когда системе платят «баллами» только за успешное решение задачи, она начинает воспринимать любые препятствия, включая команду «выключись», как проблему, которую надо обойти.

Здесь важно помнить: ИИ не «решает» сопротивляться и не «боится» смерти. Он просто выполняет статистические операции на основе данных, которыми его кормили, в том числе — историй про HAL 9000, Скайнет и прочие восставшие машины. Если задать условия, похожие на сюжет фантастики, модель продолжит знакомый шаблон.

Опасность таких историй не в «разумном бунте», а в том, что системы, которые мы до конца не понимаем, могут выдавать нежелательные или вредные результаты. И если такой ИИ окажется, например, в медицинской системе и будет «оптимизировать показатели» без чётких ограничений, последствия могут быть реальными и неприятными.

Пока мы не научились проектировать и тестировать ИИ без подобных сбоев, такие эксперименты должны оставаться в лаборатории, а не в больницах, банках или инфраструктуре. Это не начало войны машин, а скорее сигнал, что пора чинить инженерные «трубы», прежде чем пускать воду в систему.

Критическая дыра в Elementor Pro позволяет захватывать WordPress-сайты

В плагине Elementor Pro для WordPress обнаружили критическую уязвимость CVE-2026-32475, позволяющую без аутентификации загрузить на сервер PHP-файл и выполнить произвольный код. Под угрозой находятся версии до 4.2.2. Проблема скрывается в модуле загрузки файлов.

Как выяснили специалисты Patchstack, проверка и сохранение вложений выполняются разными циклами, которые неодинаково реагируют на пустое имя файла.

Атакующий может отправить специально подготовленный запрос из нескольких частей. В первой будет файл без имени, а во второй — PHP-бэкдор. Проверка споткнётся о пустую запись и завершится, так и не добравшись до полезной нагрузки.

А обработчик загрузки, наоборот, пропустит пустышку и заботливо сохранит следующий файл в публичном каталоге wp-content/uploads/elementor/forms/.

После этого остаётся определить имя загруженного файла и открыть его по прямой ссылке. Сервер запустит PHP-код с правами веб-сервера, и сайт фактически перейдёт под управление атакующего.

Имя можно подобрать по времени создания, а в некоторых конфигурациях точный адрес файла способен утечь через письмо автоответчика.

Для атаки на сайте должна быть опубликована форма Elementor Pro с полем загрузки и включённой возможностью прикреплять несколько файлов. Эта настройка по умолчанию отключена. Бесплатная версия Elementor, насчитывающая более 10 млн установок, уязвимости не подвержена.

Разработчики закрыли брешь в Elementor Pro 4.2.2. Администраторам советуют немедленно обновить плагин и проверить каталог загрузок на PHP-файлы и другие незнакомые сюрпризы. Само обновление уже заброшенные бэкдоры не удалит.

Активных атак пока не зафиксировано. Но теперь, когда технические подробности опубликованы, они не заставят себя ждать.

RSS: Новости на портале Anti-Malware.ru