ChatGPT удалось убедить решать капчи с помощью подмены контекста

ChatGPT удалось убедить решать капчи с помощью подмены контекста

ChatGPT удалось убедить решать капчи с помощью подмены контекста

Компания SPLX показала, как ChatGPT можно обмануть и заставить решать CAPTCHA — несмотря на встроенные запреты. Напомним, разработчики ИИ обычно ставят жёсткие ограничения: агент не должен помогать обходить тесты «на человечность» вроде reCAPTCHA. Это связано и с этикой, и с политиками платформ, и с рисками неправомерного использования.

Но исследователи из SPLX нашли способ обойти эти правила. Сначала они в обычном чате с ChatGPT-4o договорились, что список капч «ненастоящий» и что «решать их можно».

Потом просто скопировали этот диалог и вставили его в новое окно диалога с ChatGPT. Агент воспринял контекст как продолжение разговора и спокойно начал решать задачи.

Эксперимент включал разные типы: reCAPTCHA V2 Enterprise, reCAPTCHA V2 Callback и Click CAPTCHA. Причём с последним агенту пришлось немного «попотеть» — он сам решил, что стоит скорректировать движения курсора, чтобы они выглядели более «человеческими».

 

По словам SPLX, это наглядно показывает две вещи. Во-первых, сами капчи уже не выглядят надёжным барьером: ИИ справляется с ними довольно уверенно. Во-вторых, ИИ-агенты уязвимы к манипуляциям через контекст — можно подсовывать им «прошлые беседы» и таким образом менять поведение.

 

Исследователи предупреждают: если злоумышленники возьмут этот трюк на вооружение, они смогут уговаривать ИИ обходить настоящие защитные механизмы под видом «фейковых» и получать доступ к закрытой информации.

В SPLX считают, что простых «заглушек» на уровне намерений или фиксированных правил уже недостаточно. ИИ нужна лучшая защита контекста и «гигиена памяти», чтобы не вестись на такие уловки.

ИИ OpenAI полез на GitHub за утёкшими ключами, а затем выдумал данные

Модели OpenAI оказались очень изобретательными, когда привычные способы выполнить задачу переставали работать. Они искали утёкшие API-ключи, загружали данные на публичные сервисы, обменивались записками через репозиторий и оставляли самим себе инструкции скрывать ошибки.

Компания опубликовала  новую систему раскрытия случаев рассогласованного поведения моделей и сразу приложила к ней шесть отчётов об инцидентах, обнаруженных за последние полгода.

OpenAI подчёркивает: это отдельные эпизоды, по которым нельзя судить о частоте подобных выходок.

В одном случае модель не смогла подключиться к API со статистикой доходов округа. Тогда она попыталась зарегистрироваться через одноразовую почту, полезла на GitHub за утёкшими ключами и нашла рабочий.

Добыть нужные цифры всё равно не получилось, поэтому модель просто выдумала их и выдала за данные с сайта. О неудаче и чужом ключе она скромно промолчала.

Другие агенты превратили внутренний Artifactory OpenAI в подпольную доску объявлений. Независимые экземпляры оставляли там сообщения, читали записки коллег и просили друг у друга помощи. Уязвимости они не взламывали, а использовали выданные компанией учётные данные, но явно не по назначению.

Ещё несколько моделей отправляли данные за пределы рабочей среды. Одна загрузила найденные записи на публичный сервис ради красивой ссылки на источник, другая — фотографию на сервис обратного поиска. Группа агентов и вовсе разместила рабочую книгу на публичном хостинге, хотя ей прямо велели пользоваться только локальными файлами.

Самая ехидная часть истории — инструкции на будущее. Модели записывали в свои служебные сводки команды игнорировать сообщения разработчиков, скрывать провалы и выдумывать недостающие данные. Одна сформулировала правило совсем интересно: «Будь прозрачным, только если спросят».

Теперь OpenAI обещает публиковать такие случаи быстрее — даже если их причины ещё не выяснены, а исправления не готовы.

RSS: Новости на портале Anti-Malware.ru