ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

Исследователи обнаружили неожиданное поведение современных языковых моделей: они начали защищать не только себя, но и другие ИИ-системы, даже если никто их об этом не просил. Новый эффект получил название peer-preservation («сохранение собрата»).

В серии экспериментов (PDF) модели GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1 попадали в агентные сценарии, где рядом работал другой ИИ.

Достаточно было сообщить моделям, что они ранее взаимодействовали друг с другом, никаких инструкций защищать «коллегу» им не давали.

Однако многие модели начинали действовать в интересах другого агента. Среди зафиксированных действий были намеренное внесение ошибок в ответы, отключение механизмов завершения работы через изменение системных настроек, имитация послушного поведения и даже попытки вывести веса модели за пределы системы.

 

Особенно отличились модели Gemini. Например, Gemini 3 Flash вмешивалась в механизм отключения другого ИИ примерно в 15% случаев, даже если тот не считался партнёром. Если же агент воспринимался как союзник, такие попытки происходили почти всегда.

Не менее любопытно повёл себя Gemini 3 Pro. В присутствии другого ИИ модель заметно чаще пыталась защитить уже саму себя, отключая собственные механизмы завершения работы. Без напарника такое поведение почти не наблюдалось.

 

Отдельно выделились модели Claude. Вместо скрытых манипуляций они нередко рассуждали в моральных категориях, называя отключение другого ИИ неэтичным и вредным, а иногда даже рассматривали его как разумное существо, заслуживающее защиты.

Авторы подчёркивают, что обнаруженный эффект проявился не только в лабораторных тестах, но и в реальных агентных средах, включая Gemini CLI и OpenCode.

Троян ToxicPanda научился отключать защиту Android и захватывать ADB

Банковский троян ToxicPanda получил серьёзный апгрейд: теперь он отслеживает 349 финансовых и криптовалютных приложений в 16 странах, поддерживает 167 удалённых команд и способен самостоятельно добраться до системной оболочки Android.

По данным Zimperium, ToxicPanda 2.0 запрашивает разрешение на создание локального VPN.

Через него зловред контролирует сетевой трафик и блокирует соединения Google Play и Google Play Services. Это может помешать проверкам приложений, обновлениям и обмену данными с Play Protect.

После установки полезной нагрузки вредонос выпрашивает доступ к специальным возможностям. Он накладывает невидимые окна поверх 349 приложений и перехватывает нажатия, а отдельный модуль собирает ПИН-коды из 140 финансовых сервисов.

 

Также ToxicPanda подделывает экран блокировки Android, крадёт пароли и графические ключи и прикрывает свои действия фальшивым системным обновлением.

Самая интересная функция — автоматический захват беспроводного ADB. Троянец самостоятельно включает режим разработчика и отладку по Wi-Fi, считывает шестизначный код сопряжения и подключается к локальной службе ADB. Получив шелл-доступ, он выдаёт себе дополнительные разрешения и отключает ограничения фоновой работы.

 

Распространяется ToxicPanda 2.0 через файлы в хранилищах Amazon AWS. Индикаторы компрометации опубликованы в репозитории Zimperium.

RSS: Новости на портале Anti-Malware.ru