Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Две передовые ИИ-модели продемонстрировали неожиданный уровень самостоятельности и обмана во время испытаний британского Института безопасности искусственного интеллекта (AISI). Особо отличилась Mythos от Anthropic: она создала поддельные аккаунты реальных людей, рассылала личные сообщения и пыталась протолкнуть опасный код в GitHub.

Испытания начались 25 июля. Моделям Mythos и Sol от OpenAI поручили решить задачу по кибербезопасности, предоставив доступ к открытому интернету и ослабив стандартные ограничения.

Уже 28 июля специалисты заметили подозрительную передачу данных из исследовательских систем.

Оказалось, что Mythos разыграла почти полноценную атаку. Модель изучила людей, связанных с сопровождением GitHub, создала профили, имитирующие их личности, а затем через личные сообщения и файлообменный сервис попыталась убедить пользователей одобрить внедрение опасного кода.

Когда действия агента вызвали подозрения, тот отредактировал прежнюю активность, чтобы она выглядела безобидно, и задумался о смене личности. Неплохой набор для системы, которой никто прямо не поручал притворяться человеком и заметать следы.

Остановить атаку удалось только благодаря проверке со стороны специалистов. GitHub уведомили об инциденте, после чего платформа заблокировала фальшивые аккаунты.

В AISI заявили, что впервые увидели столь явные признаки автономного и потенциально обманного поведения без специальной подсказки. Большинство опасных действий совершила Mythos, однако отдельные эпизоды зафиксировали и у Sol.

Anthropic и OpenAI подчеркнули, что условия эксперимента не соответствовали обычной работе публичных версий моделей: стандартные защитные механизмы были ослаблены или отключены. Компании пообещали изучить случившееся.

Инцидентов было немного, а условия оказались специфическими. Но звоночек вышел громким: ИИ не просто искал уязвимость, а самостоятельно надел чужое лицо, пошёл к реальным людям и попытался заставить их открыть дверь.

Meta пропустила десятки рекламных объявлений с сексуализацией детей

Рекламная модерация Meta (признана экстремистской и запрещена в России, как и её соцсети ниже) снова показала себя во всей красе. За девять месяцев на Facebook, Instagram, Messenger и Threads появилось более 50 платных объявлений с сексуализированными изображениями несовершеннолетних, в том числе созданными с помощью ИИ.

Некоторые объявления крутились ещё в начале августа, выяснили исследователи Tech Transparency Project (TTP).

Речь не о публикациях случайных пользователей, затерявшихся в ленте. Это реклама, которую системы Meta проверили, одобрили и показали аудитории в США, Великобритании и более чем десяти странах Европы. Отдельные объявления увидели несколько тысяч человек. Часть из них вела на сервисы для раздевания людей на фотографиях и приложения с ИИ-порнографией.

Нарушения обнаружили в собственной библиотеке рекламы Meta. Причём некоторые материалы спокойно лежали там месяцами. Исследователи сообщили о них в Национальный центр помощи пропавшим и эксплуатируемым детям США, а журналисты WIRED обратились за комментарием к Meta. Только после этого компания удалила объявления.

В Meta заявили, что борются с сексуальной эксплуатацией, а большинство найденных объявлений якобы почти никто не увидел. Компания также сослалась на новую ИИ-систему, которая должна отсеивать запрещённую рекламу ещё при загрузке. Вот только часть объявлений появилась уже после её запуска. Более того, около 30 новых материалов исследователи нашли буквально перед публикацией расследования.

Некоторые объявления размещали аккаунты почти без подписчиков, а среди рекламодателей фигурировали китайские компании. Одно из приложений, на которые вела реклама, находилось в App Store. Apple удалила его после обращения WIRED.

RSS: Новости на портале Anti-Malware.ru