ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

Исследователи обнаружили неожиданное поведение современных языковых моделей: они начали защищать не только себя, но и другие ИИ-системы, даже если никто их об этом не просил. Новый эффект получил название peer-preservation («сохранение собрата»).

В серии экспериментов (PDF) модели GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1 попадали в агентные сценарии, где рядом работал другой ИИ.

Достаточно было сообщить моделям, что они ранее взаимодействовали друг с другом, никаких инструкций защищать «коллегу» им не давали.

Однако многие модели начинали действовать в интересах другого агента. Среди зафиксированных действий были намеренное внесение ошибок в ответы, отключение механизмов завершения работы через изменение системных настроек, имитация послушного поведения и даже попытки вывести веса модели за пределы системы.

 

Особенно отличились модели Gemini. Например, Gemini 3 Flash вмешивалась в механизм отключения другого ИИ примерно в 15% случаев, даже если тот не считался партнёром. Если же агент воспринимался как союзник, такие попытки происходили почти всегда.

Не менее любопытно повёл себя Gemini 3 Pro. В присутствии другого ИИ модель заметно чаще пыталась защитить уже саму себя, отключая собственные механизмы завершения работы. Без напарника такое поведение почти не наблюдалось.

 

Отдельно выделились модели Claude. Вместо скрытых манипуляций они нередко рассуждали в моральных категориях, называя отключение другого ИИ неэтичным и вредным, а иногда даже рассматривали его как разумное существо, заслуживающее защиты.

Авторы подчёркивают, что обнаруженный эффект проявился не только в лабораторных тестах, но и в реальных агентных средах, включая Gemini CLI и OpenCode.

Linux-компьютер подключили к Apple Find My и получили геолокацию юзеров

22-летний исследователь Zerotistic зарегистрировал Linux-компьютер в инфраструктуре Apple Find My и научил его получать координаты людей. На работу ушло меньше недели экспериментов с закрытыми протоколами компании. Это не способ следить за любым владельцем iPhone.

Linux-устройство видит только местоположение людей, которые уже добровольно поделились им с владельцем соответствующей учётной записи Apple.

Как объяснил исследователь, сначала он прошёл стандартную аутентификацию Apple и сформировал запрос на сертификат устройства. Неожиданно сервер принял старомодную конструкцию: PKCS#10, 2048-битный ключ RSA и подпись SHA-1. После этого Apple выдала сертификат Identity Services и фактически признала Linux-машину привязанным устройством.

Затем компьютер пришлось зарегистрировать в службах Find My и Apple Push Notification Service, указать поддерживаемое шифрование и ключи для обмена сообщениями. Запрос SubscribeAndFetch заставил устройство друга отправить новому клиенту зашифрованный ключ геолокации.

Финальным этапом стал скрипт, который распаковывает сообщения Apple, извлекает ключ и расшифровывает координаты, время и точность определения местоположения.

Исследование показывает, что ограничение Find My устройствами Apple держится не только на аппаратной платформе, но и на умении правильно изображать участника её закрытой экосистемы.

RSS: Новости на портале Anti-Malware.ru