ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

Исследователи обнаружили неожиданное поведение современных языковых моделей: они начали защищать не только себя, но и другие ИИ-системы, даже если никто их об этом не просил. Новый эффект получил название peer-preservation («сохранение собрата»).

В серии экспериментов (PDF) модели GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1 попадали в агентные сценарии, где рядом работал другой ИИ.

Достаточно было сообщить моделям, что они ранее взаимодействовали друг с другом, никаких инструкций защищать «коллегу» им не давали.

Однако многие модели начинали действовать в интересах другого агента. Среди зафиксированных действий были намеренное внесение ошибок в ответы, отключение механизмов завершения работы через изменение системных настроек, имитация послушного поведения и даже попытки вывести веса модели за пределы системы.

 

Особенно отличились модели Gemini. Например, Gemini 3 Flash вмешивалась в механизм отключения другого ИИ примерно в 15% случаев, даже если тот не считался партнёром. Если же агент воспринимался как союзник, такие попытки происходили почти всегда.

Не менее любопытно повёл себя Gemini 3 Pro. В присутствии другого ИИ модель заметно чаще пыталась защитить уже саму себя, отключая собственные механизмы завершения работы. Без напарника такое поведение почти не наблюдалось.

 

Отдельно выделились модели Claude. Вместо скрытых манипуляций они нередко рассуждали в моральных категориях, называя отключение другого ИИ неэтичным и вредным, а иногда даже рассматривали его как разумное существо, заслуживающее защиты.

Авторы подчёркивают, что обнаруженный эффект проявился не только в лабораторных тестах, но и в реальных агентных средах, включая Gemini CLI и OpenCode.

Исследователь заставил Kaspersky Endpoint Security записать DLL в System32

Независимый исследователь под псевдонимом Nightmare Eclipse опубликовал экспериментальный эксплойт HardBreacher для уязвимости в Kaspersky Endpoint Security. По его словам, неизвестная ранее брешь позволяет обычному пользователю обойти ограничения Windows и создать файл в защищённой директории C:\Windows\System32.

Эксплойт тестировался на полностью обновлённой Windows 11 25H2 с Kaspersky Endpoint Security 14.0.0.504.

При успешном запуске эксплойт создавал в System32 файл MY_SNAKE_IS_SOLID.dll, после чего предоставлял текущему непривилегированному пользователю полный доступ к нему. В нормальной ситуации стандартная учётная запись проделать такой трюк не может.

Предполагаемая проблема связана с взаимодействием защитного продукта и его интерфейсного процесса. Получив контроль над ним, исследователь смог влиять на операции с файлами и нарушать работу отдельных механизмов программы. Полные технические детали пока не раскрыты.

 

Сам автор признаёт, что HardBreacher работает нестабильно: запуски часто заканчиваются ошибкой, поэтому попытки приходится повторять. Стабильное выполнение произвольного кода с правами SYSTEM также не продемонстрировано.

Независимые специалисты пока не воспроизвели результат. Уязвимость не получила CVE, а «Лаборатория Касперского» публично не подтвердила проблему и не назвала возможные затронутые версии. Делать выводы обо всей линейке продуктов по одному испытанному выпуску рано.

Однако опубликованный код уже привлекает внимание. Ранее инструменты Nightmare Eclipse для обхода Microsoft Defender пытались применять в реальных атаках, хотя большинство попыток провалилось.

Update:

Официальный комментарий «Лаборатории Касперского»:

«"Лаборатория Касперского" устранила недостаток, обнаруженный с помощью экспериментальной утилиты HardBreacher. Обновление с необходимыми исправлениями выпущено и устанавливается автоматически — при необходимости пользователи также могут запустить его вручную».

RSS: Новости на портале Anti-Malware.ru