Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Подпишитесь на новости

Boeing 737 MAX может потерять автопилот в самый неудобный момент

У Boeing снова проблемы с программным обеспечением 737 MAX. Компания обнаружила сбой, способный отключить функцию автоматической навигации в один из самых неподходящих моментов — при заходе самолёта на посадку.

Как сообщает The Wall Street Journal, проблема появилась после обновления ПО в кабине пилотов. Ошибка может проявиться, если после ухода на второй круг экипаж изменит запланированный маршрут.

В некоторых ситуациях пилотам придётся перейти на ручное управление и отключить часть функций автопилота. Представители отрасли опасаются, что это создаст дополнительную нагрузку на экипаж при полёте на небольшой высоте.

Boeing уведомила авиакомпании о проблеме ещё в конце августа, но заявила, что угрозы безопасности она не представляет. Сейчас компания готовит временную процедуру, позволяющую повторно активировать автоматическую навигацию, и разрабатывает обновление ПО. Дополнительные рекомендации обещают выпустить к ноябрю, а окончательное исправление — только в начале 2028 года.

Такой график понравился не всем. Southwest Airlines и United Airlines, по данным издания, не захотели принимать новые 737 MAX с проблемной версией ПО и запросили установку предыдущей. Федеральное управление гражданской авиации США уже изучает ситуацию и обещает принять меры при необходимости.

Сбой может затронуть и планы по новым моделям MAX 7 и MAX 10. Последнюю уже заказали Delta, United, American и Alaska, однако результаты проверки FAA способны повлиять на её сертификацию.

Сейчас в мире эксплуатируются 2422 самолёта Boeing 737 MAX 8 и 9. А сама линейка всё никак не может сбросить шлейф проблем: после двух катастроф её полёты приостанавливали почти на два года. Теперь к репутационному багажу добавилось ещё одно обновление, которое лучше было не устанавливать.

RSS: Новости на портале Anti-Malware.ru