Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Потребление китайских LLM в России выросло более чем в 11 раз

Российские компании резко нарастили использование китайских больших языковых моделей. По данным MWS Cloud, за первое полугодие 2026 года бизнес израсходовал более 400 млрд токенов — в 11,3 раза больше, чем за весь 2025-й, когда показатель составлял 39,1 млрд.

Безоговорочным лидером осталось семейство Qwen. В 2025 году на него приходилось 20 млрд токенов и 51,1% потребления, а за первые шесть месяцев 2026-го — уже 261,1 млрд и 59,1%.

Второе место сохранила GLM: 91,2 млрд токенов и 20,7%. А вот DeepSeek, занимавшая годом ранее третью строчку, уступила её Kimi. Модели этого семейства набрали 81,4 млрд токенов и 18,4%. Китайская нейросетевая гонка идёт настолько бодро, что вчерашний фаворит сегодня уже ищет себя за пределами пьедестала.

Статистика основана на данных платформ MWS GPT Model Hub и MWS GPT. Их основными клиентами выступают крупные компании. Бизнес использует LLM для работы чат-ботов, персонализации рекламы, подготовки рассылок и описаний товаров, а также анализа отзывов и обращений клиентов. В общем, нейросетям поручают всё, что нужно делать круглосуточно, быстро и желательно без жалоб на понедельник.

По оценке MWS Cloud, весь российский рынок LLM в 2026 году вырастет на 35%, до 19,6 млрд рублей. Облачный сегмент, включающий доступ к моделям по SaaS и API, приблизится к 1,5 млрд рублей.

На фоне спроса MWS Cloud расширила каталог Model Hub почти вдвое — до 17 моделей. В него вошли GLM 5.2, Kimi K2.6, Qwen3.6, Gemma 4, GPT OSS, а также средства распознавания и синтеза речи и реранкеры для поисковых систем и RAG-конвейеров. Доступ предоставляется через единый OpenAI-совместимый API.

Судя по объёму токенов, российский бизнес уже не экспериментирует с китайскими LLM. Он кормит ими рабочие процессы — и аппетит растёт быстрее, чем успевает обновляться каталог моделей.

RSS: Новости на портале Anti-Malware.ru