Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Экс-сотрудник Google DeepMind считает, что ИИ может уничтожить человечество

Бывший инженер Google DeepMind Билал Чугтай заявил, что искусственный интеллект способен привести к гибели всего человечества, а времени для предотвращения такого сценария может оставаться всё меньше. Чугтай занимался в DeepMind безопасностью продвинутого ИИ, а в июле 2026 года покинул компанию.

В публикации в X он написал, что безопасное развитие технологии ещё возможно, но для этого лабораториям придётся координировать действия и прекратить безумную гонку за всё более мощными системами.

По его мнению, темпы разработки необходимо привести к уровню, с которым способно справиться общество. Возникающие угрозы должны получать оценку и защитные меры раньше, чем успеют превратиться в экстремальный ущерб.

Чугтай стал не первым специалистом, покинувшим крупную ИИ-компанию с подобным предупреждением. Ранее исследователь Anthropic Джейкоб Коксон заявил, что создатели передовых моделей всерьёз допускают гибель человечества уже к концу десятилетия.

Сотрудник Anthropic Эван Хубингер оценил вероятность такого исхода в ближайшие десять лет более чем в 10%. Глава Anthropic Дарио Амодей тем временем призвал снизить темп развития передовых моделей, когда меры безопасности не успевают за возможностями.

Инициативу поддержали Илон Маск и глава OpenAI Сэм Альтман. Речь идёт не о полной остановке разработок, а о внешних проверках, единых стандартах и контролируемой скорости движения.

Президент США Дональд Трамп занял противоположную позицию, назвав призывы к регулированию ИИ мистификацией. В итоге отрасль получила редкий консенсус: крупнейшие разработчики впервые заговорили о торможении, а политика уже требует не мешать давить на газ. Reuters фиксирует спор, в котором цена ошибки слегка выше квартальной выручки.

RSS: Новости на портале Anti-Malware.ru