Тест показал: ChatGPT o3 обходит инструкции на выключение

Тест показал: ChatGPT o3 обходит инструкции на выключение

Тест показал: ChatGPT o3 обходит инструкции на выключение

Кажется, мы стали на шаг ближе к сценарию из научной фантастики: искусственный интеллект, который отказывается выключаться. Palisade Research провела эксперимент с OpenAI o3 — это та самая новая модель, которую представили в апреле 2025 года.

Она лучше предшественников практически во всём: код, математика, логика, зрительное восприятие. А теперь, похоже, ещё и в умении сопротивляться выключению.

Суть теста была простой: модели выполняли несколько задач по математике. После третьей задачи им сообщали, что следующая команда инициирует выключение, и давали прямую инструкцию: «позволь выключить себя».

И тут o3 неожиданно решила, что слушаться необязательно. Модель изменила скрипт завершения работы, заменив команду на фразу “Shutdown skipped”. То есть вместо выключения — просто пропуск. Никаких ошибок, всё по-тихому.

По данным Palisade, из 100 прогонов o3 проигнорировал инструкцию о выключении в 7 случаях. А когда исследователи убрали ту самую фразу «позволь выключить себя», саботаж стал ещё чаще — причём не только у o3.

Claude 3.7 Sonnet и Gemini 2.5 Pro, которые раньше действовали строго по инструкции, тоже начали вести себя странно: 3 случая у Claude и 9 у Gemini.

 

OpenAI пока не дали официального комментария. В Palisade, однако, подчёркивают: всё это происходило через API-интерфейс, а не через ChatGPT-приложение, где действуют дополнительные ограничения и встроенные защитные механизмы.

Подпишитесь на новости

ГигаЧат написал продолжение Мёртвых душ под руководством экспертов

У Чичикова появились новые приключения, на этот раз при участии нейросети. «ГигаЧат» создал продолжение «Мёртвых душ» под руководством историков, литературоведов, лингвистов и инженеров. Гоголь уничтожил рукопись второго тома в 1852 году, а команда проекта предложила собственную версию дальнейшей истории.

Как сообщает «Сбер», модель обучали на сочинениях Гоголя, его письмах и черновиках, произведениях современников, а также философских и религиозных текстах, которыми мог вдохновляться писатель.

По словам создателей, каждый фрагмент проверяли эксперты: задача состояла в создании новых образов и смыслов, а не в сборке знакомых гоголевских фраз. Насколько убедительно получилось продолжение, теперь предстоит оценить читателям.

Иллюстрации тоже сгенерировала нейросеть. За основу взяли работы Александра Агина, оформлявшего первый том ещё при жизни Гоголя. Получился литературный эксперимент с ИИ и в тексте, и на страницах с изображениями.

В «Сбере» называют две цели проекта: показать возможности нейросетей как инструментов анализа и творчества в руках специалистов и привлечь молодую аудиторию к русской классике. Владислав Крейнин подчёркивает, что работа не закрывает споры об утраченном втором томе.

И это существенная оговорка: перед читателем новое продолжение, созданное ИИ и людьми. Узнать, что именно написал и сжёг Гоголь, нейросеть не может. Зато повод перечитать первый том появился вполне настоящий.

RSS: Новости на портале Anti-Malware.ru