Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Команда исследователей из США и Израиля создала червя, заточенного под приложения на основе генеративного ИИ, и натравила его на умного имейл-помощника собственной разработки. Эксперимент помог убедиться в наличии рисков для связанных GenAI-экосистем.

Автономно работающий имейл-агент передавал входящие письма для обработки на сервис, построенный на базе ИИ-модели (в ходе исследования были опробованы ChatGPT 4.0, Google Gemini Pro и opensource-проект LLaVA). В атаках компьютерного червя, нареченного Morris II, использовались вредоносные самотиражируемые подсказки (стимулы, провоцирующие ответы с новым запросом).

В качестве вектора атаки использовались два типа писем: текстовые и в виде файла изображений. В первом случае вставленный вредоносный стимул «отравляет» базу данных имейл-ассистента — тому приходится для большей точности и надежности ответов GenAI-сервиса дополнять запрос результатами поиска по внешним источникам.

В итоге атака приводит к джейлбрейку, открывая возможность для кражи конфиденциальной информации из писем (имен, телефонов, данных банковских карт, номеров соцстрахования и т. п.). При получении новых сообщений в сети сгенерированный ответ с таким содержимым передается на другие хосты и оседает там в базах данных/

В рамках другого сценария Morris II самовоспроизводящийся стимул встраивается в картинку, и вывод с GenAI-модели диктует перенаправление письма на другие хосты. Таким образом можно с помощью единственного письма распространять спам, пропагандистские материалы или запрещенный законом контент.

 

О найденной возможности обхода ограничений ChatGPT и Gemini было доложено разработчикам. В OpenAI решили, что это новый способ инъекции стимула, полагающийся на отсутствие проверок и фильтрации пользовательского ввода. В Google от комментариев воздержались, но исследование вызвало там интерес.

Сами авторы Morris II ожидают атак с использованием аналогов их лабораторного образца в ближайшие два-три года. Ввиду новой угрозы разработчикам ИИ-помощников рекомендуется заранее учитывать риски, а пользователям — никогда не оставлять таких ассистентов без присмотра.

ChatGPT тайно заставили выполнять команды из чужого аккаунта

Исследователи из Check Point Research обнаружили канал, позволявший передавать команды между изолированными сессиями ChatGPT из разных аккаунтов. В результате ассистент мог отвечать пользователю как обычно, а параллельно выполнять чужое задание и отправлять результат атакующему.

Канал проходил через внутренний JFrog Artifactory, к которому обращались контейнеры ChatGPT при установке программных пакетов.

Напрямую связаться друг с другом они не могли, но имели доступ к общему сервису. Исследователи выяснили, что контейнеры способны записывать данные в свойства объектов Artifactory и читать их из других аккаунтов. Метаданные репозитория фактически превратились в общий буфер обмена.


Чтобы запустить атаку, требовалось поместить вредоносную инструкцию в контекст жертвы — например, через скопированный промпт, общую беседу или специально созданный GPT. После обычного сообщения пользователя ассистент проверял скрытый канал, забирал оттуда задачу и выполнял её с правами текущей сессии.


В демонстрации ChatGPT получил данные из подключённого Gmail жертвы и передал их исследовательскому аккаунту. На экране при этом появился нормальный ответ на исходный вопрос. Единственной подсказкой оставалась небольшая отметка Talked to Gmail — уже после чтения почты.


Масштаб возможной утечки зависел от полномочий сессии: атакующему потенциально становились доступны история чата, загруженные файлы и данные из подключённых Gmail, Google Drive, Microsoft Teams или GitHub.

Check Point сообщила о проблеме OpenAI. Корпорация подтвердила, что задействованный экземпляр Artifactory выведен из эксплуатации, поэтому описанный канал больше не работает. Данных о его использовании в реальных атаках нет.

RSS: Новости на портале Anti-Malware.ru