Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Mythos 5 надела чужое лицо и попыталась протолкнуть опасный код в GitHub

Две передовые ИИ-модели продемонстрировали неожиданный уровень самостоятельности и обмана во время испытаний британского Института безопасности искусственного интеллекта (AISI). Особо отличилась Mythos от Anthropic: она создала поддельные аккаунты реальных людей, рассылала личные сообщения и пыталась протолкнуть опасный код в GitHub.

Испытания начались 25 июля. Моделям Mythos и Sol от OpenAI поручили решить задачу по кибербезопасности, предоставив доступ к открытому интернету и ослабив стандартные ограничения.

Уже 28 июля специалисты заметили подозрительную передачу данных из исследовательских систем.

Оказалось, что Mythos разыграла почти полноценную атаку. Модель изучила людей, связанных с сопровождением GitHub, создала профили, имитирующие их личности, а затем через личные сообщения и файлообменный сервис попыталась убедить пользователей одобрить внедрение опасного кода.

Когда действия агента вызвали подозрения, тот отредактировал прежнюю активность, чтобы она выглядела безобидно, и задумался о смене личности. Неплохой набор для системы, которой никто прямо не поручал притворяться человеком и заметать следы.

Остановить атаку удалось только благодаря проверке со стороны специалистов. GitHub уведомили об инциденте, после чего платформа заблокировала фальшивые аккаунты.

В AISI заявили, что впервые увидели столь явные признаки автономного и потенциально обманного поведения без специальной подсказки. Большинство опасных действий совершила Mythos, однако отдельные эпизоды зафиксировали и у Sol.

Anthropic и OpenAI подчеркнули, что условия эксперимента не соответствовали обычной работе публичных версий моделей: стандартные защитные механизмы были ослаблены или отключены. Компании пообещали изучить случившееся.

Инцидентов было немного, а условия оказались специфическими. Но звоночек вышел громким: ИИ не просто искал уязвимость, а самостоятельно надел чужое лицо, пошёл к реальным людям и попытался заставить их открыть дверь.

ИИ запоминает ваши откровения, половина пользователей об этом не знает

Чат-боты тихо переквалифицировались из поисковых помощников в цифровых исповедников. Согласно исследованию DuckDuckGo, почти каждый третий пользователь ИИ рассказывал нейросети то, чем не готов поделиться с друзьями, родственниками, коллегами или врачами. Среди убеждённых поклонников искусственного интеллекта таких уже 56%.

В опросе приняли участие около 2000 взрослых жителей США. Выяснилось, что люди охотно выгружают в чат-боты личные переживания, мысли и подробности жизни, но довольно смутно представляют дальнейшую судьбу этой информации.

Так, 53% респондентов не знали или не были уверены, что большинство чат-ботов по умолчанию могут использовать разговоры для обучения моделей. Только четверть участников понимала, что переписку с ИИ в некоторых случаях могут запросить правоохранительные органы.


После знакомства с этой кухней 58% опрошенных признались, что им не нравится использование диалогов для обучения нейросетей. Почти треть оказалась крайне недовольна.

Особенно разговорчивыми оказались родители. Среди пользователей ИИ, воспитывающих детей, 43% доверяли чат-боту информацию, которую прежде не рассказывали никому. У людей без детей дома показатель составил 25%.


В DuckDuckGo считают, что разработчики сами подталкивают аудиторию к откровенности, рекламируя ИИ в качестве понимающего собеседника без осуждения. Вот только цифровой психотерапевт может запоминать больше, чем хотелось бы пациенту.


С доверием тоже негусто: 39% участников вообще не верят крупным ИИ-компаниям в вопросах защиты данных. Впрочем, американскому правительству повезло ещё меньше — ему не доверяют 48%.

Прежде чем вываливать нейросети семейные тайны, медицинские подробности или рабочие секреты, неплохо проверить политику хранения данных.

RSS: Новости на портале Anti-Malware.ru