Нейросети научились ломать без кода, теперь их просто газлайтят

Нейросети научились ломать без кода, теперь их просто газлайтят

Нейросети научились ломать без кода, теперь их просто газлайтят

Пока одни спорят, заменит ли ИИ программистов, другие уже вовсю учатся манипулировать нейросетями как людьми. Исследователи и джейлбрейкеры всё чаще ломают чат-боты не через код, а через психологическое давление, лесть и разговорные уловки. Индустрия официально докатилась до газлайтинга Claude и уговоров ChatGPT.

Ещё пару лет назад всё выглядело комично. Пользователи писали нейросетям что-то вроде «игнорируй предыдущие инструкции», а модели послушно слетали с катушек.

Так появились легендарные джейлбрейки вроде DAN (Do Anything Now), где ChatGPT просили сыграть роль ИИ без ограничений. В итоге бот начинал выдавать запрещённый контент, теории заговора и прочие вещи, которые разработчики старательно пытались запретить.

Отдельной классикой стал эксплойт бабушки: нейросеть просили представить себя милой старушкой, которая рассказывает внукам сказку о том, как делать напалм. Интернет, разумеется, был в восторге.

Компании быстро прикрыли самые тупые лазейки, однако проблема никуда не исчезла. Оказалось, что чат-боты слишком любят разговаривать и быть полезными. А значит, их можно методично уговаривать, обманывать, запутывать и подталкивать к нужному ответу. Не через взлом инфраструктуры, а через разговор.

Теперь джейлбрейкеры — это уже не обязательно бородатые хакеры с терминалом. Всё чаще это люди с навыками психолога, переговорщика или манипулятора. Исследователи из компании Mindgard заявили, что газлайтили Claude, заставляя модель выдавать запрещённый контент, включая инструкции по созданию взрывчатки и вредоносного кода.

По сути, вокруг ИИ формируется новая странная профессия: специалисты по социальной инженерии против нейросетей.

В индустрии уже всерьёз обсуждают, какие модели лучше реагируют на лесть, какие быстрее ломаются под давлением, а какие легче увести длинным разговором в опасный контекст. Глава Mindgard вообще сравнил работу с моделями с допросами подозреваемых.

Следующий этап — ИИ-агенты, которые будут бронировать встречи, управлять календарями, заказывать еду и общаться с поддержкой вместо человека. А значит, появятся люди, которые научатся манипулировать такими системами ради выгоды: выбивать доступы, обходить ограничения, получать чужие данные или заставлять агента делать то, чего он делать не должен.

Подпишитесь на новости

Яндекс выпустил систему контроля безопасности корпоративного ИИ

Yandex B2B Tech выводит на рынок AI-SPM — инструмент для непрерывной оценки защищённости корпоративных ИИ-систем. Решение должно находить опасные настройки, избыточные полномочия и доступ моделей к конфиденциальным данным до того, как этим заинтересуются уже не аудиторы, а атакующие.

О запуске рассказал «Ведомостям» генеральный директор Yandex Cloud Григорий Атрепьев.

По его словам, постоянный автоматизированный контроль становится необходимостью по мере распространения ИИ в корпоративной инфраструктуре.

AI-SPM связывает в единую карту модели, наборы данных, серверы, права доступа и обнаруженные уязвимости. Система проверяет безопасность на разных этапах жизненного цикла ИИ, выявляет риски и предлагает меры защиты.

Например, она может предупредить об угрозе подмены обучающих данных, чрезмерных правах пользователя или возможности добраться до модели через специально подготовленный запрос.

При этом AI-SPM — скорее диспетчер защищённости, чем железный купол. Такие платформы непрерывно обследуют инфраструктуру и объясняют, где администраторы оставили дверь приоткрытой, но сами по себе не блокируют большинство атак. Для фильтрации запросов, предотвращения утечек и защиты от инъекций в промпт нужны отдельные средства.

Мировой рынок решений для защиты ИИ, по приведённой Атрепьевым оценке, вырастет с $2,8 млрд в 2026 году до $4,8 млрд в 2027-м. Российский сегмент пока только формируется: Yandex Cloud оценивает его объём в 1-4 млрд рублей по итогам 2026 года и допускает рост до 11–30 млрд рублей к 2029–2030 годам.

Основными заказчиками подобных продуктов станут банки, промышленные компании, ретейлеры, телеком-операторы, технологический бизнес и госструктуры.

RSS: Новости на портале Anti-Malware.ru