Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

WhatsApp и Signal позволяют следить за человеком по одной галочке

Исследователи из Венского университета обнаружили в WhatsApp (принадлежит корпорации Meta, признанной экстремистской и запрещённой в России) и Signal побочный канал, позволяющий незаметно отслеживать активность и примерное местоположение пользователя. Для атаки достаточно знать номер телефона, устанавливать вредонос или уговаривать жертву нажать на ссылку не требуется.

Проблема скрывается в уведомлениях о доставке. Когда сообщение достигает устройства получателя, мессенджер автоматически отправляет подтверждение.

Измеряя время между отправкой запроса и получением ответа — Round-Trip Time, или RTT, — атакующий может определить, находится ли смартфон в активном режиме, заблокирован ли экран и какое соединение используется.

Один замер почти ничего не расскажет. Но серия скрытых запросов уже складывается в цифровое расписание: когда человек пользуется телефоном, бывает дома или в офисе, перемещается между сетями и включает компьютер с привязанным клиентом.


Стабильная задержка может указывать на знакомую сеть Wi-Fi, а её изменение — на переход к мобильной связи или смену местоположения. GPS тут никто не взламывает, но привычки пользователя начинают светиться и без него.

Атака не вызывает уведомлений и работает даже без предыдущей переписки с жертвой. WhatsApp и Signal отправляют отдельные подтверждения от каждого подключённого устройства, поэтому следить можно одновременно за смартфоном, веб-версией и настольным клиентом.

Эксперты также показали возможность определять тип ОС и расходовать трафик и заряд аккумулятора скрытыми запросами. Исследование опубликовано на arXiv.


Разработчики мессенджеров знают о проблеме и применяют ограничения частоты запросов. Однако это лишь замедляет наблюдение: полностью отключить подтверждения доставки нельзя, поскольку они встроены в саму логику работы сервисов.

Для рядового пользователя массовая слежка таким способом маловероятна. Зато журналистам, активистам, политикам и жертвам сталкинга есть о чём задуматься.

RSS: Новости на портале Anti-Malware.ru