Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Android-приложения научились обходить блокировку трафика вне VPN

Исследователь Армин Шупук обнаружил в Android механизм, позволяющий обычному приложению отправлять пакеты мимо VPN даже при включённой функции «Блокировать соединения без VPN». Никакого root-доступа, ADB и опасных разрешений не требуется — достаточно штатного системного API.

Проблема связана с NAT-T keepalive — короткими пакетами UDP/4500, которые поддерживают сетевое соединение активным. Android может поручить их отправку чипу Wi-Fi, минуя обычный сетевой путь приложения и проверки VPN Lockdown.

В результате установленная программа способна регулярно обращаться к выбранному злоумышленником серверу через физическую сеть. Передавать произвольные данные таким способом нельзя: содержимое пакета задаёт сама платформа.

Однако получатель видит реальный IP-адрес устройства, время отправки и факт его присутствия в сети. Этого достаточно для определения провайдера, сопоставления активности и отслеживания перемещений между сетями.

Исследователь подтвердил утечку на Pixel 8 Pro с Android 16: роутер фиксировал пакет вне VPN каждые десять секунд. На смартфоне Samsung соединение оставалось активным более 24 часов. Работа механизма также подтверждена на устройстве Nothing, хотя отдельный перехват трафика для него не проводился.

По оценке автора, проблема затрагивает большинство устройств на Android 12 и новее, поддерживающих аппаратную отправку NAT-T keepalive через Wi-Fi. Однако полноценные испытания выполнены только на трёх моделях, поэтому речь идёт об оценке класса устройств, а не о проверке каждого смартфона на рынке.

Отчёт передали Google 15 мая 2026 года. Корпорация признала его дубликатом уже зарегистрированной проблемы, но сведения о CVE, исправлении или сроках выпуска патча публично не раскрыты.

До устранения ошибки пользователям с повышенными требованиями к анонимности рекомендуют пропускать весь трафик смартфона через внешний VPN-маршрутизатор, отключив мобильную сеть и альтернативные подключения.

RSS: Новости на портале Anti-Malware.ru