Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Firefox для iOS получил встроенный бесплатный блокировщик рекламы

Mozilla начала тестировать встроенную блокировку рекламы в мобильном Firefox для iOS. Функция появилась в свежем обновлении браузера, но пока имеет экспериментальный статус и доступна только части пользователей. Блокировщик работает на сетевом уровне и использует фильтры на основе EasyList.

Он останавливает запросы к сторонним рекламным сетям, биржам и трекерам, а также пытается убирать объявления и всплывающие окна до их полноценной загрузки.

Однако тотальной зачистки ждать не стоит. Новая функция не блокирует объявления в результатах поиска Google, Bing, DuckDuckGo и других поисковых систем. Спонсируемые материалы на домашней странице Firefox и в новой вкладке тоже сохранят неприкосновенность.

Активировать эксперимент можно по пути «Настройки» → «Просмотр сайтов» → «Медиа» → Ad Blocker. Переключатель также доступен в меню открытого сайта, поэтому защиту можно настраивать непосредственно во время просмотра страницы.

 

Mozilla добавила встроенный блокировщик в публичную дорожную карту Firefox ещё в начале лета 2026 года. Разработчики объясняют необходимость собственной функции ограничениями iOS: на платформе Apple они не могут выпускать полноценные браузерные расширения в том же виде, как для настольных систем и других платформ.

Пока неизвестно, когда эксперимент станет доступен всем владельцам iPhone и изменятся ли правила фильтрации после тестирования.

RSS: Новости на портале Anti-Malware.ru