Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Перевод Дурову могут счесть финансированием терроризма, но не автоматически

Российские счета основателя Telegram Павла Дурова* должны заблокировать после его включения в перечень террористов и экстремистов Росфинмониторинга. Ограничения распространяются прежде всего на личные финансы и имущество Дурова*.

Об этом РИА Новости сообщил адвокат Дмитрий Рощин. Банки и другие финансовые организации обязаны приостановить операции по его счетам в России.

При этом Telegram не становится автоматически запрещённым или экстремистским ресурсом, уточняют «Известия». Мессенджер и его основатель с точки зрения закона — всё-таки не одно и то же.

С переводами Дурову* ситуация сложнее. Сам факт отправки денег ещё не превращает человека в финансиста терроризма. Для уголовной ответственности потребуется доказать, что средства предназначались именно для террористической деятельности, подчеркнул адвокат.

Росфинмониторинг внёс предпринимателя в перечень 30 июля. Ранее ФСБ предъявила ему обвинение в содействии террористической деятельности и объявила в международный розыск.

По версии ведомства, администрация Telegram не удалила каналы, чаты и боты, которые украинские спецслужбы якобы использовали при подготовке диверсий, терактов, массовых убийств и кибератак в России. Виновным Дурова* пока не признали, это может сделать только суд.

* Внесён Росфинмониторингом в перечень террористов и экстремистов.

RSS: Новости на портале Anti-Malware.ru