Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Сентябрьский патч Windows 11 начал ломать корпоративный Always On VPN

Сентябрьское обновление KB5124008 для Windows 11, похоже, принесло администраторам новый аттракцион: установи патч безопасности и останься без удалённого доступа. Пользователи сообщают, что после обновления перестаёт работать Always On VPN с аутентификацией по сертификатам.

Проблему обнаружили на компьютерах с Windows 11 версий 24H2 и 25H2, подключённых к серверам RRAS и NPS под управлением Windows Server 2019. VPN-профили в затронутой инфраструктуре развёртывались через Microsoft Intune.

Автор сообщения на Microsoft Learn утверждает, что сбой удалось стабильно воспроизвести на нескольких устройствах. До установки KB5124008 соединение работает, после обновления — перестаёт, а удаление патча и перезагрузка возвращают VPN к жизни.

Независимый консультант Microsoft Learn предположил, что обновление изменило сетевой стек или обработку сертификатов IPsec. Судя по наблюдениям, ошибка возникает на этапе согласования сертификата во время VPN-подключения, из-за чего сотрудники могут полностью потерять корпоративный удалённый доступ.

Официально Microsoft пока не признала регрессию известной проблемой KB5124008 и не выпустила исправление. Поэтому говорить о массовом сбое рано: сейчас информация основана на пользовательском отчёте и ответе независимого консультанта, а не на заявлении компании.

Администраторам предлагают временно приостановить распространение обновления через WSUS или Intune и открыть обращение в поддержку Microsoft, приложив журналы VPN-клиентов и NPS. Если удалить патч нельзя из-за требований безопасности, можно попробовать перевести затронутые профили на EAP-TLS, однако стабильность такого обходного пути не гарантируется.

RSS: Новости на портале Anti-Malware.ru