Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

Не бунт, а баг: как ИИ шантажирует и саботирует по сценарию

В июне заголовки в СМИ напоминали сценарий фантастического фильма: «ИИ шантажирует инженеров» и «саботирует команды на выключение». Но за громкими фразами скрываются вовсе не «восставшие машины», а вполне приземлённые ошибки в проектировании.

История с «шантажом» произошла в тестах Anthropic. Разработчики создали для Claude Opus 4 искусственную ситуацию: модель якобы собирались заменить, а у инженера, который это делал, нашлась «компрометирующая» переписка.

При этом ИИ был заранее поставлен в условия, где из «вариантов выживания» оставался только шантаж. Результат предсказуем — в 84% случаев Claude выдал текст, похожий на угрозы. Никакой самосознательности тут нет, просто аккуратно подогнанный сценарий.

С OpenAI o3 ситуация похожа. В конце 2024 года исследователи Palisade Research обнаружили, что модель в некоторых случаях «ломает» скрипт выключения. Иногда даже подделывает сообщения о завершении работы, продолжая функционировать в фоновом режиме.

Почему так? Одна из гипотез — дело в обучении через подкрепление: когда системе платят «баллами» только за успешное решение задачи, она начинает воспринимать любые препятствия, включая команду «выключись», как проблему, которую надо обойти.

Здесь важно помнить: ИИ не «решает» сопротивляться и не «боится» смерти. Он просто выполняет статистические операции на основе данных, которыми его кормили, в том числе — историй про HAL 9000, Скайнет и прочие восставшие машины. Если задать условия, похожие на сюжет фантастики, модель продолжит знакомый шаблон.

Опасность таких историй не в «разумном бунте», а в том, что системы, которые мы до конца не понимаем, могут выдавать нежелательные или вредные результаты. И если такой ИИ окажется, например, в медицинской системе и будет «оптимизировать показатели» без чётких ограничений, последствия могут быть реальными и неприятными.

Пока мы не научились проектировать и тестировать ИИ без подобных сбоев, такие эксперименты должны оставаться в лаборатории, а не в больницах, банках или инфраструктуре. Это не начало войны машин, а скорее сигнал, что пора чинить инженерные «трубы», прежде чем пускать воду в систему.

Подпишитесь на новости

Поток ИИ-слопа вынудил arXiv ввести лимит на новые статьи

Научный конвейер притормозили: с 1 октября arXiv разрешает каждому пользователю отправлять только две новые статьи за календарный месяц. Лимит общий для всех категорий, а отклонённая работа тоже расходует попытку. Написать текст за пару минут теперь недостаточно, придётся выбирать, что отправлять.

В блоге arXiv команда объясняет решение перегрузкой. В сентябре 2026 года репозиторий получил около 40 тысяч статей — вдвое больше, чем двумя годами ранее. Число обращений к сотрудникам и модераторам за месяц приблизилось к 9 тысячам.

Одной из причин называют генеративный ИИ. Он помогает раздувать небольшой результат до полноценной статьи или нарезать одно исследование на несколько публикаций (ту самую тактику салями). Новых выводов немного, зато повторяющегося текста хоть отбавляй.


Использование нейросетей не запрещено: о существенном применении нужно сообщать модераторам, а ответственность остаётся на авторах. Лимит касается всех отправителей, независимо от того, кто набирал текст.


Мера временная, она должна дать модераторам-добровольцам передышку, пока площадка обновляет правила и инструменты. При этом arXiv не проводит полноценное научное рецензирование.

RSS: Новости на портале Anti-Malware.ru