Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Экспериментальный ИИ-червь Morris II умеет воровать данные и рассылать спам

Команда исследователей из США и Израиля создала червя, заточенного под приложения на основе генеративного ИИ, и натравила его на умного имейл-помощника собственной разработки. Эксперимент помог убедиться в наличии рисков для связанных GenAI-экосистем.

Автономно работающий имейл-агент передавал входящие письма для обработки на сервис, построенный на базе ИИ-модели (в ходе исследования были опробованы ChatGPT 4.0, Google Gemini Pro и opensource-проект LLaVA). В атаках компьютерного червя, нареченного Morris II, использовались вредоносные самотиражируемые подсказки (стимулы, провоцирующие ответы с новым запросом).

В качестве вектора атаки использовались два типа писем: текстовые и в виде файла изображений. В первом случае вставленный вредоносный стимул «отравляет» базу данных имейл-ассистента — тому приходится для большей точности и надежности ответов GenAI-сервиса дополнять запрос результатами поиска по внешним источникам.

В итоге атака приводит к джейлбрейку, открывая возможность для кражи конфиденциальной информации из писем (имен, телефонов, данных банковских карт, номеров соцстрахования и т. п.). При получении новых сообщений в сети сгенерированный ответ с таким содержимым передается на другие хосты и оседает там в базах данных/

В рамках другого сценария Morris II самовоспроизводящийся стимул встраивается в картинку, и вывод с GenAI-модели диктует перенаправление письма на другие хосты. Таким образом можно с помощью единственного письма распространять спам, пропагандистские материалы или запрещенный законом контент.

 

О найденной возможности обхода ограничений ChatGPT и Gemini было доложено разработчикам. В OpenAI решили, что это новый способ инъекции стимула, полагающийся на отсутствие проверок и фильтрации пользовательского ввода. В Google от комментариев воздержались, но исследование вызвало там интерес.

Сами авторы Morris II ожидают атак с использованием аналогов их лабораторного образца в ближайшие два-три года. Ввиду новой угрозы разработчикам ИИ-помощников рекомендуется заранее учитывать риски, а пользователям — никогда не оставлять таких ассистентов без присмотра.

Шанс гибели человечества из-за ИИ выше 10%, считает экс-сотрудник Anthropic

Бывший сотрудник Anthropic Джейкоб Коксон предупредил, что гонка за всё более мощным искусственным интеллектом может привести к экзистенциальной угрозе для человечества. А руководитель направления Alignment Science в Anthropic Эван Хубингер добавил конкретики: по его личной оценке, вероятность гибели всех людей из-за ИИ в течение ближайших десяти лет превышает 10%.

Коксон покинул Anthropic, выразив тревогу из-за курса компании и всей индустрии.

Главный риск он связывает с появлением систем, способных действовать автономно и самостоятельно улучшать свои возможности. Если развитие таких моделей выйдет за пределы человеческого понимания, вернуть их под контроль может оказаться слегка сложнее, чем закрыть вкладку в браузере.

Хубингер подчеркнул, что его цифра не является официальным прогнозом Anthropic. По оценке компании, современные модели пока несут низкий риск. Исследователя тревожит следующий этап — возникновение сверхинтеллекта благодаря рекурсивному самоулучшению, которое, по его словам, развивается быстрее ожидаемого.

В основе проблемы лежит alignment — попытка заставить мощные ИИ-системы действовать в соответствии с человеческими намерениями. Специалисты занимаются этим годами, однако гарантированного способа контролировать гипотетический сверхинтеллект до сих пор нет.

При этом разработчики не собираются притормаживать: компании соревнуются в автономности, скорости и сложности моделей, пока безопасники пытаются успеть пристегнуть ремни к уже разгоняющейся ракете.

Ещё недавно главными страхами вокруг генеративного ИИ были дипфейки, сокращение рабочих мест и массовая дезинформация. Теперь внутри самой индустрии всё громче обсуждают сценарий полного исчезновения человечества.

Окажутся эти оценки трезвым предупреждением или слишком мрачной спекуляцией, пока неизвестно.

RSS: Новости на портале Anti-Malware.ru