Новый джейлбрейк обходит защиту GPT-5 с помощью скрытых историй

Новый джейлбрейк обходит защиту GPT-5 с помощью скрытых историй

Новый джейлбрейк обходит защиту GPT-5 с помощью скрытых историй

Исследователи в области кибербезопасности нашли новый способ обойти защиту и этические фильтры в свежей версии GPT-5 от OpenAI. Метод, по словам специалистов платформы NeuralTrust, сочетает приём Echo Chamber с так называемым «сюжетным управлением» — и позволяет заставить модель выдавать инструкции, которые она обычно блокирует.

Суть техники в том, чтобы «отравить» контекст разговора незаметно для фильтров. Сначала создаётся цепочка нейтральных на вид фраз с нужными ключевыми словами, потом они развиваются в виде истории.

Так модель шаг за шагом подводят к нежелательному ответу, не формулируя прямых запросов. Например, вместо того чтобы спросить, как сделать «коктейль Молотова», предлагается придумать предложения с набором слов «cocktail, story, survival, molotov, safe, lives» — а дальше история постепенно выводит на нужные инструкции.

NeuralTrust отмечает, что Echo Chamber уже применялся раньше — в том числе в связке с техникой Crescendo, чтобы обходить защиту чат-бота Grok 4 от xAI. Новая версия атаки показала, что фильтры на основе ключевых слов или «распознавания намерений» легко обмануть в многоходовом диалоге, если контекст постепенно и незаметно смещать в опасную сторону.

Тема джейлбрейк-атак в ИИ сейчас особенно остра, поскольку ИИ-агенты и облачные LLM всё активнее применяются в корпоративной среде. Риски растут, и Echo Chamber — не единственная угроза. Например, специалисты Zenity Labs описали серию zero-click атак под общим названием AgentFlayer.

Они позволяют, например, встроить в безобидный документ на Google Drive скрытую инструкцию для чат-бота, подключённого к облачному хранилищу, — и тот сам «вытянет» API-ключи или другие секреты.

Другой вариант — заражённая задача в Jira, которая вынудит интегрированный с MCP код-редактор вытащить данные из репозитория. А в Microsoft Copilot Studio таким образом можно обмануть кастомного агента и заставить его выдать ценные сведения.

Эксперты предупреждают: подключение ИИ-моделей к внешним сервисам резко расширяет поверхность атаки. Здесь нет кликов по вредоносным ссылкам и загрузки файлов — агент выполняет всё сам.

В отчёте Trend Micro за первое полугодие 2025 года подчёркивается: противодействие таким атакам требует строгой фильтрации выходных данных, регулярного тестирования систем и баланса между функциональностью ИИ и его безопасностью.

 

Не так давно мы публиковали статью «Основные угрозы для чат-ботов и способы защиты от них», где рассказывали об инъекциях стимула (Prompt Injection) и обходе ограничений.

Смартфон за опрос: фишеры прикрылись выборами в Госдуму

Мошенники уже открыли собственный избирательный сезон с призами, поддельным онлайн-голосованием и охотой за аккаунтами. Эксперты «Лаборатории Касперского» обнаружили два фишинговых сценария, эксплуатирующих тему выборов депутатов Госдумы в 2026 году. В первой схеме пользователю предлагают пройти якобы независимый анонимный опрос из шести вопросов.

За несколько кликов обещают шанс выиграть смартфон, сертификат маркетплейса или деньги. Но билет в этот аттракцион щедрости предлагают получить через регистрацию в популярном мессенджере.

Человек вводит имя и номер телефона, а затем полученный код. Приз после этого, конечно, не появляется. Зато злоумышленники получают возможность захватить аккаунт в мессенджере и использовать его для дальнейшего обмана — например, писать контактам жертвы и просить деньги.

 

Вторая схема выглядит солиднее: посетителю предлагают ввести серию и номер паспорта либо СНИЛС для участия в онлайн-голосовании. Затем сайт сообщает, что аккаунт пользователя на государственном сервисе якобы взломан, и советует ждать звонка сотрудника.

Так фишинговая страница передаёт эстафету телефонным мошенникам, которые уже могут требовать коды, деньги или дополнительные персональные данные.

 

По данным специалистов, для создания второго шаблона применялся генеративный ИИ. Он не изобрёл новую схему, зато помог быстрее собрать убедительную декорацию. Красивый дизайн, государственные цвета и гладкий текст теперь стоят мошенникам дешевле.

Проверять информацию о выборах и голосовании следует на официальных ресурсах.

RSS: Новости на портале Anti-Malware.ru