Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Flying Eagle превратил Android-смартфоны в карманные камеры слежения

Исследователи из Hunt.io разобрали Android-троян Flying Eagle, который распространяется под видом приложений Бюро общественной безопасности. Жертве предлагают установить APK с поддельного сайта вроде 110gongan[.]com, а затем выдать ему доступ к Accessibility Services. После этого смартфон фактически меняет хозяина.

Троян записывает нажатия клавиш, делает скриншоты, показывает фишинговые окна поверх банковских и государственных приложений, читает СМС, включает камеру и микрофон. Через Android API dispatchGesture операторы могут дистанционно нажимать кнопки и управлять интерфейсом устройства.

Flying Eagle оказался не одной вредоносной программой, а целой фабрикой слежки. В единой панели злоумышленники собирают APK с нужными фишинговыми шаблонами, управляют заражёнными смартфонами и получают украденные данные. Один обнаруженный сервер показывал 46 жертв, 29 из которых оставались онлайн.

Конструктор умеет менять названия пакетов и классов, добавлять мусорные данные для обхода антивирусов и шифровать связь с командным сервером. Отдельные компоненты так и называются: LiveKeysStrok отвечает за кейлоггинг, ScreenCaps — за снимки экрана, а Webjector — за поддельные формы. Следы также связывают платформу с семейством SpyNote.

За 30 дней исследователи насчитали не менее 170 активных серверов Flying Eagle. Большинство находилось в Гонконге, но узлы обнаружились также в США, Канаде, Финляндии, Малайзии и Японии.

После утечки исходников в феврале 2026 года троян окончательно пошёл по рукам. В Telegram продают сборки примерно за 2000 USDT, раздают фишинговые шаблоны и предлагают обналичивать похищенные деньги за комиссию до 50%.

 

На подходе уже наследник — Night Dragon. Ему добавили режим чёрного экрана, автоматическое скрытие и кражу данных Alipay, WeChat, банковских приложений и криптокошельков. Старый орёл ещё летает, а нового дракона уже выпустили на охоту.

RSS: Новости на портале Anti-Malware.ru