Модели Text-to-SQL можно использовать для кражи данных или DoS

Модели Text-to-SQL можно использовать для кражи данных или DoS

Модели Text-to-SQL можно использовать для кражи данных или DoS

Исследователи рассказали о новых кибератаках, в которых злоумышленники используют модель Text-to-SQL для создания вредоносного кода, позволяющего собирать конфиденциальную информацию и проводить DoS-атаки.

«Для лучшего взаимодействия с пользователями БД-приложения применяют ИИ-технологии, способные переводить вопросы человека в SQL-запросы. Такая техника носит название Text-to-SQL», — объясняет один из специалистов Шеффилдского университета Ксютан Пень.

«Мы выяснили, что злоумышленники могут обойти модели Text-to-SQL и создать вредоносный код с помощью специально подготовленных вопросов. В результате это может привести к утечке данных или DoS, поскольку злонамеренный код будет выполняться в базе данных».

Согласно отчёту, эксперты тестировали свои выводы на двух коммерческих решениях — BAIDU-UNIT и AI2sql. Таким образом у них получился первый в истории случай, когда модели обработки текстов на естественном языке (Natural Language Processing, NLP) использовались в качестве вектора кибератаки.

Так называемые «атаки чёрного ящика» можно сравнить с SQL-инъекцией, когда вредоносная нагрузка копируется в сконструированный SQL-запрос. В итоге такие запросы могут позволить атакующему модифицировать базы данных бэкенда и вызвать DoS на сервере.

 

Кроме того, эксперты изучали возможность компрометации предварительно обученных языковых моделей (PLM), что должно было приводить к генерации вредоносных команд по специальным триггерам.

«Есть много способов установки бэкдоров в PLM-фреймворках: замена слов, разработка специальных подсказок и модификация стилей», — отмечают исследователи.

Атаки бэкдора на четыре разные модели с открытым исходным кодом — BART-BASE, BART-LARGE, T5-BASE и T5-3B — показали 100-проценную успешность с незначительным влиянием на производительность. В реальном сценарии такие атаки будет трудно детектировать.

Права авторов при обучении ИИ уточнят в подзаконных актах осенью

Новый закон о поддержке развития искусственного интеллекта не отменяет Гражданский кодекс и не превращает произведения авторов в бесплатный корм для нейросетей. Об этом заявила советник президента России Елена Ямпольская. Закон, подписанный президентом 26 июля, разрешает использовать общедоступные и правомерно опубликованные материалы для обучения российских алгоритмов ИИ.

Однако правообладатель может закрыть свои работы от такой обработки техническими средствами. Бесконтрольно загружать в модели всё, до чего дотянулся парсер, нельзя.

Как именно будет работать этот механизм, пока предстоит решить. Подзаконные акты, по данным «Ведомостей», начнут появляться осенью. При их подготовке власти обещают учесть опасения творческих отраслей, представители которых предупреждали об обесценивании интеллектуальной собственности.

Эксперты тем временем предлагают несколько способов помирить нейросети с авторами. Среди них — отказ от использования произведений по требованию правообладателя, коллективное лицензирование и отчисление части прибыли ИИ-продуктов в компенсационный фонд.

В РАНХиГС считают, что разработчиков генеративных моделей стоит обязать вести закрытые реестры обучающих данных и показывать их регуляторам. Так можно будет понять, чьи произведения попали в датасет, не раскрывая коммерческую тайну.

Юрист Михаил Семенов предлагает разделять сценарии. Если модель копирует голос актёра, манеру художника или тексты конкретного писателя, потребуется прямой договор и выплаты. При массовом обучении на миллиардах материалов искать каждого автора нереально — здесь пригодился бы аналог авторского общества для ИИ.

В отрасли есть и более жёсткий взгляд: чрезмерные ограничения могут ударить и по экономике, и по культуре. Поэтому властям предстоит настроить систему так, чтобы модели не остались голодными, а авторы — с красивым обещанием вместо денег.

RSS: Новости на портале Anti-Malware.ru