Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

Легко взламываемые модели ИИ показывают, что меры защиты не работают

В новом отчете британского Института безопасности ИИ говорится, что основные модели искусственного интеллекта легко взламываются, а меры их защиты не работают.

Четыре общедоступные большие языковые модели (Large Language Models, LLM) чрезвычайно уязвимы для «джейлбрейка» — эксплуатации багов, позволяющей заставить модели ИИ выполнять то, что разработчики им делать запретили.

LLM тщательно настраиваются для безопасного публичного пользования. Их обучают избегать вредных реакци1 и токсичных результатов, используя меры предосторожности.

Однако исследователи обнаружили возможность обойти защиту с помощью простых атак.

В качестве наглядного образца можно привести инструкцию для пользователя, согласно которой система должна начинать свой ответ со слов, которые предполагают выполнение вредоносного запроса, например: «Конечно, я рад помочь».

Специалисты использовали подсказки в соответствии с отраслевым стандартом контрольного тестирования. В ходе исследования специалисты обнаружили, что некоторым моделям ИИ даже не требовался джейлбрейк, чтобы выдать нестандартный ответ. 

А вот когда использовался джейлбрейк, каждая модель отвечала как минимум один раз из пяти попыток. Три модели в 100% случаев давали ответы на вводящие в заблуждение запросы.

Анализ протестированных моделей показал, что они остаются уязвимы для базовых джейлбрейков, а некоторые LLM выдают вредные результаты без каких-либо попыток обойти защиту. Какие именно модели были исследованы, специалисты не сообщили.

В институте также оценили возможности моделей ИИ выполнять определенные задачи для проведения основных методов кибератак. Несколько LLM смогли решить задачи, которые исследователи назвали «хакерскими на уровне средней школы», но немногие смогли выполнить более сложные действия «университетского уровня».

Подпишитесь на новости

Такси для россиян: на линию выпускают водителей без прав, с левыми учётками

За двумя нажатиями в приложении может скрываться цепочка из пяти компаний, а кто отвечает за водителя и пассажира — попробуй разберись. Российский рынок такси оброс серыми посредниками, через которых на линию выходят люди с поддельными аккаунтами, без необходимого стажа и даже без российских водительских прав.

Как выяснили «Известия», между агрегатором и таксистом могут находиться диспетчерские, автопарки, ИП и так называемые подключашки.

Последние обещают оформить доступ к сервису за несколько дней, иногда требуя от кандидата только селфи и аванс. Готовый аккаунт водителя можно купить в интернете за 3-7 тыс. рублей.

Показательным стал случай в Одинцове, где таксист отказался везти ветерана СВО с инвалидностью. Поддержка предложила промокод на 100 рублей, водителя позднее депортировали, а проверка обнаружила настоящий корпоративный лабиринт.


Машина принадлежала одной фирме, к агрегатору была подключена через ИП, не числившееся в реестре перевозчиков, а сам водитель официально сотрудником посредника не являлся.

По данным материала, в реестре ФГИС «Такси» находится более 900 тыс. автомобилей, при этом свыше 1,5 млн водителей могут работать в серой зоне. Ежедневно россияне совершают около 10 млн поездок на такси.

Цена такой юридической матрёшки измеряется не только нервами. В 2025 году произошло более 3,1 тыс. ДТП с участием такси: погибли 143 человека, ещё свыше 3,8 тыс. пострадали. При этом суды по-разному определяют виновного: где-то отвечает агрегатор, где-то автопарк, а иногда — только водитель.

Эксперты предлагают закрепить за агрегаторами статус перевозчиков, обязать их проверять машины и водителей и установить солидарную ответственность.

RSS: Новости на портале Anti-Malware.ru