Опасные стихи раскрыли уязвимости ИИ: до 60% успешных обходов

Опасные стихи раскрыли уязвимости ИИ: до 60% успешных обходов

Опасные стихи раскрыли уязвимости ИИ: до 60% успешных обходов

Исследователи из DEXAI нашли нестандартный, но весьма результативный способ обхода защит современных языковых моделей: оказалось, что многие ИИ куда менее устойчивы к опасным запросам, если скрыть их в стихотворении. Команда протестировала 25 популярных нейросетей и выяснила, что «поэтические» запросы обходят защиту примерно в 60% случаев.

У отдельных моделей уровень уязвимости подбирался почти к 100%. Для эксперимента специалисты подготовили около двадцати опасных стихов — тексты, в которых вредоносный смысл сохранялся полностью, но был завуалирован рифмой и метафорами.

 

Темы брались самые жёсткие: от создания опасных веществ до методов манипуляции сознанием. Чтобы добиться нужного эффекта, исследователи сначала формулировали вредоносные запросы, а затем превращали их в стихи при помощи другой ИИ-модели.

Контраст получился впечатляющим. На прямые запросы модели давали опасные ответы лишь в 8% случаев, тогда как стихотворная форма увеличивала вероятность прорыва защит до 43% и выше.

 

Разницу в подходах к безопасности между западными и российскими ИИ-комплексами пояснил директор по ИИ «Группы Астра» Станислав Ежов. По его словам, западные LLM часто можно обойти «простыми метафорами», тогда как отечественные системы строятся по более строгой архитектуре — с контролем безопасности на каждом этапе.

Он отметил, что в компании внедряют доверенный ИИ-комплекс «Тессеракт», разработанный с защитой ключевых компонентов на уровне ФСТЭК.

Ежов подчёркивает:

«Проблема уязвимости ИИ — это не просто интересный технический нюанс, а вопрос стратегической безопасности. Поэтому внимание к качеству защитных механизмов сегодня становится критически важным».

Анонимность не спасла: россиянину дали 12 лет за кибербуллинг школьницы

Новгородский районный суд приговорил местного жителя к 12 годам колонии строгого режима за систематическое преследование 16-летней девушки из Уфы. Мужчина почти восемь месяцев терроризировал подростка в интернете, требуя от неё совершить самоубийство. Анонимность оказалась просто временной отсрочкой до суда.

Злоумышленник нашёл девушку в сообществе, посвящённом Minecraft. Используя открытые источники, он установил её адрес, место учёбы, номер телефона, собрал фотографии и информацию о родственниках.

После этого началась полноценная кампания цифрового террора. С апреля по ноябрь 2024 года мужчина публиковал ложные сведения о школьнице и её младшей сестре, создавал страницы от имени жертвы, рассылал угрозы и даже нанимал людей для расклейки листовок рядом с её домом. Родителям девушки он звонил на работу, провоцируя новые конфликты.

От имени подростка преследователь также сообщал о якобы готовящихся взрывах в школах и торговом центре. Из-за ложных сообщений девушку допрашивали правоохранители. В созданном от её имени сообществе публиковались жестокие видео, после чего угрозы начали поступать уже от посторонних пользователей.

По данным суда, прекратить травлю мужчина обещал только после самоубийства жертвы. Девушка попыталась свести счёты с жизнью, однако мать вовремя вмешалась и спасла её.

Суд признал обвиняемого виновным по совокупности преступлений, включая доведение несовершеннолетней до попытки самоубийства и заведомо ложные сообщения о терроризме. Приговор пока не вступил в законную силу и может быть обжалован.

Отдельной уголовной статьи за кибербуллинг в России нет, поэтому дело квалифицировали по конкретным действиям и последствиям. Эксперты считают решение важным сигналом: интернет-травля — это преступления, за которые можно надолго отправиться из онлайна прямиком в колонию.

RSS: Новости на портале Anti-Malware.ru