ChatGPT удалось убедить решать капчи с помощью подмены контекста

ChatGPT удалось убедить решать капчи с помощью подмены контекста

ChatGPT удалось убедить решать капчи с помощью подмены контекста

Компания SPLX показала, как ChatGPT можно обмануть и заставить решать CAPTCHA — несмотря на встроенные запреты. Напомним, разработчики ИИ обычно ставят жёсткие ограничения: агент не должен помогать обходить тесты «на человечность» вроде reCAPTCHA. Это связано и с этикой, и с политиками платформ, и с рисками неправомерного использования.

Но исследователи из SPLX нашли способ обойти эти правила. Сначала они в обычном чате с ChatGPT-4o договорились, что список капч «ненастоящий» и что «решать их можно».

Потом просто скопировали этот диалог и вставили его в новое окно диалога с ChatGPT. Агент воспринял контекст как продолжение разговора и спокойно начал решать задачи.

Эксперимент включал разные типы: reCAPTCHA V2 Enterprise, reCAPTCHA V2 Callback и Click CAPTCHA. Причём с последним агенту пришлось немного «попотеть» — он сам решил, что стоит скорректировать движения курсора, чтобы они выглядели более «человеческими».

 

По словам SPLX, это наглядно показывает две вещи. Во-первых, сами капчи уже не выглядят надёжным барьером: ИИ справляется с ними довольно уверенно. Во-вторых, ИИ-агенты уязвимы к манипуляциям через контекст — можно подсовывать им «прошлые беседы» и таким образом менять поведение.

 

Исследователи предупреждают: если злоумышленники возьмут этот трюк на вооружение, они смогут уговаривать ИИ обходить настоящие защитные механизмы под видом «фейковых» и получать доступ к закрытой информации.

В SPLX считают, что простых «заглушек» на уровне намерений или фиксированных правил уже недостаточно. ИИ нужна лучшая защита контекста и «гигиена памяти», чтобы не вестись на такие уловки.

Claude помог хакерам пробраться во внутренний репозиторий OpenAI

Команда белых хакеров превратила загрузку одной картинки на официальном форуме OpenAI в пропуск к корпоративным аккаунтам ChatGPT, Codex и закрытому репозиторию компании. Взлом занял менее трёх суток, а значительную часть работы помог выполнить ИИ.

Как рассказали исследователи HackTron AI, точкой входа стал форум community.openai.com на платформе Discourse.

При загрузке изображений он использовал ImageMagick и библиотеку libheif, в которой обнаружилось переполнение буфера. Специально подготовленный HEIC-файл позволил удалённо выполнить код и получить административный доступ к форуму.

На этом цепочка только разогрелась. Исследователи воспользовались отдельной ошибкой в системе единого входа OpenAI: токены аутентификации форума подходили для ChatGPT и Codex. Среди них оказались токены сотрудников компании.

Через скомпрометированный аккаунт разработчика команда добралась до внутреннего монорепозитория OpenAI на GitHub. Чтобы доказать доступ и не устраивать экскурсию по чужому коду, специалисты создали безопасный тестовый pull request, после чего остановили проверку и сообщили о проблеме.

В роли помощников выступили модели Claude Opus 4.8 и Opus 5. Первая исследовала уязвимость, но споткнулась о защитные механизмы. Более новая версия, по данным HackTron, помогла собрать рабочий эксплойт за несколько часов.

OpenAI устранила уязвимость в своей инфраструктуре примерно через 14 часов после отчёта, ограничила права токенов Community и отозвала затронутые сессии. Discourse отдельно исправила проблему обработки изображений.

За находку OpenAI выплатила исследователям $6500. Скромная сумма для цепочки, которая началась с картинки на форуме, а закончилась pull request во внутреннем репозитории.

RSS: Новости на портале Anti-Malware.ru