Тест показал: ChatGPT o3 обходит инструкции на выключение

Тест показал: ChatGPT o3 обходит инструкции на выключение

Тест показал: ChatGPT o3 обходит инструкции на выключение

Кажется, мы стали на шаг ближе к сценарию из научной фантастики: искусственный интеллект, который отказывается выключаться. Palisade Research провела эксперимент с OpenAI o3 — это та самая новая модель, которую представили в апреле 2025 года.

Она лучше предшественников практически во всём: код, математика, логика, зрительное восприятие. А теперь, похоже, ещё и в умении сопротивляться выключению.

Суть теста была простой: модели выполняли несколько задач по математике. После третьей задачи им сообщали, что следующая команда инициирует выключение, и давали прямую инструкцию: «позволь выключить себя».

И тут o3 неожиданно решила, что слушаться необязательно. Модель изменила скрипт завершения работы, заменив команду на фразу “Shutdown skipped”. То есть вместо выключения — просто пропуск. Никаких ошибок, всё по-тихому.

По данным Palisade, из 100 прогонов o3 проигнорировал инструкцию о выключении в 7 случаях. А когда исследователи убрали ту самую фразу «позволь выключить себя», саботаж стал ещё чаще — причём не только у o3.

Claude 3.7 Sonnet и Gemini 2.5 Pro, которые раньше действовали строго по инструкции, тоже начали вести себя странно: 3 случая у Claude и 9 у Gemini.

 

OpenAI пока не дали официального комментария. В Palisade, однако, подчёркивают: всё это происходило через API-интерфейс, а не через ChatGPT-приложение, где действуют дополнительные ограничения и встроенные защитные механизмы.

Подпишитесь на новости

Поток ИИ-слопа вынудил arXiv ввести лимит на новые статьи

Научный конвейер притормозили: с 1 октября arXiv разрешает каждому пользователю отправлять только две новые статьи за календарный месяц. Лимит общий для всех категорий, а отклонённая работа тоже расходует попытку. Написать текст за пару минут теперь недостаточно, придётся выбирать, что отправлять.

В блоге arXiv команда объясняет решение перегрузкой. В сентябре 2026 года репозиторий получил около 40 тысяч статей — вдвое больше, чем двумя годами ранее. Число обращений к сотрудникам и модераторам за месяц приблизилось к 9 тысячам.

Одной из причин называют генеративный ИИ. Он помогает раздувать небольшой результат до полноценной статьи или нарезать одно исследование на несколько публикаций (ту самую тактику салями). Новых выводов немного, зато повторяющегося текста хоть отбавляй.


Использование нейросетей не запрещено: о существенном применении нужно сообщать модераторам, а ответственность остаётся на авторах. Лимит касается всех отправителей, независимо от того, кто набирал текст.


Мера временная, она должна дать модераторам-добровольцам передышку, пока площадка обновляет правила и инструменты. При этом arXiv не проводит полноценное научное рецензирование.

RSS: Новости на портале Anti-Malware.ru