Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

ИИ запоминает ваши откровения, половина пользователей об этом не знает

Чат-боты тихо переквалифицировались из поисковых помощников в цифровых исповедников. Согласно исследованию DuckDuckGo, почти каждый третий пользователь ИИ рассказывал нейросети то, чем не готов поделиться с друзьями, родственниками, коллегами или врачами. Среди убеждённых поклонников искусственного интеллекта таких уже 56%.

В опросе приняли участие около 2000 взрослых жителей США. Выяснилось, что люди охотно выгружают в чат-боты личные переживания, мысли и подробности жизни, но довольно смутно представляют дальнейшую судьбу этой информации.

Так, 53% респондентов не знали или не были уверены, что большинство чат-ботов по умолчанию могут использовать разговоры для обучения моделей. Только четверть участников понимала, что переписку с ИИ в некоторых случаях могут запросить правоохранительные органы.


После знакомства с этой кухней 58% опрошенных признались, что им не нравится использование диалогов для обучения нейросетей. Почти треть оказалась крайне недовольна.

Особенно разговорчивыми оказались родители. Среди пользователей ИИ, воспитывающих детей, 43% доверяли чат-боту информацию, которую прежде не рассказывали никому. У людей без детей дома показатель составил 25%.


В DuckDuckGo считают, что разработчики сами подталкивают аудиторию к откровенности, рекламируя ИИ в качестве понимающего собеседника без осуждения. Вот только цифровой психотерапевт может запоминать больше, чем хотелось бы пациенту.


С доверием тоже негусто: 39% участников вообще не верят крупным ИИ-компаниям в вопросах защиты данных. Впрочем, американскому правительству повезло ещё меньше — ему не доверяют 48%.

Прежде чем вываливать нейросети семейные тайны, медицинские подробности или рабочие секреты, неплохо проверить политику хранения данных.

RSS: Новости на портале Anti-Malware.ru