Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Верховный суд запретил в России группировки Silent Crow и Киберпартизаны BY

Верховный суд РФ признал экстремистскими организациями и запретил деятельность киберпреступных группировок Silent Crow («Молчаливый ворон») и «Киберпартизаны BY». Решение подлежит немедленному исполнению. Заседание прошло в закрытом режиме.

Суд удовлетворил административный иск Генпрокуратуры, которая обвинила обе группировки в совместных атаках на информационную инфраструктуру России и Белоруссии.

Их целью власти считают дестабилизацию обстановки и неконституционную смену государственной власти.

По данным суда, «Киберпартизаны BY» входят в белорусское объединение «Супраціў» («Сопротивление»), выступающее за насильственное изменение конституционного строя республики. Группировку также связали с запрещённым в России «Полком имени Кастуся Калиновского» и подразделением информационно-психологических операций ВСУ.

Silent Crow, ранее известная как CyberWar и Cyber LegionsUA, описывается в решении как проукраинское объединение политически мотивированных хактивистов. Его основной целью суд назвал нанесение ущерба российским госорганам, компаниям и критической информационной инфраструктуре.

Обеим группировкам приписывают атаки на ИТ-системы «Аэрофлота», базы «Ростелекома» и Росреестра, а также серверы Белорусской железной дороги.

Теперь у Silent Crow и «Киберпартизан» в России не только цифровой, но и вполне официальный статус: их деятельность запрещена, а участие в ней и поддержка организации могут повлечь ответственность.

RSS: Новости на портале Anti-Malware.ru