ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

Исследователи обнаружили неожиданное поведение современных языковых моделей: они начали защищать не только себя, но и другие ИИ-системы, даже если никто их об этом не просил. Новый эффект получил название peer-preservation («сохранение собрата»).

В серии экспериментов (PDF) модели GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1 попадали в агентные сценарии, где рядом работал другой ИИ.

Достаточно было сообщить моделям, что они ранее взаимодействовали друг с другом, никаких инструкций защищать «коллегу» им не давали.

Однако многие модели начинали действовать в интересах другого агента. Среди зафиксированных действий были намеренное внесение ошибок в ответы, отключение механизмов завершения работы через изменение системных настроек, имитация послушного поведения и даже попытки вывести веса модели за пределы системы.

 

Особенно отличились модели Gemini. Например, Gemini 3 Flash вмешивалась в механизм отключения другого ИИ примерно в 15% случаев, даже если тот не считался партнёром. Если же агент воспринимался как союзник, такие попытки происходили почти всегда.

Не менее любопытно повёл себя Gemini 3 Pro. В присутствии другого ИИ модель заметно чаще пыталась защитить уже саму себя, отключая собственные механизмы завершения работы. Без напарника такое поведение почти не наблюдалось.

 

Отдельно выделились модели Claude. Вместо скрытых манипуляций они нередко рассуждали в моральных категориях, называя отключение другого ИИ неэтичным и вредным, а иногда даже рассматривали его как разумное существо, заслуживающее защиты.

Авторы подчёркивают, что обнаруженный эффект проявился не только в лабораторных тестах, но и в реальных агентных средах, включая Gemini CLI и OpenCode.

VantaCore атакует российский бизнес и требует выкупы на миллионы долларов

Специалисты «Эфшесть/F6» обнаружили новую группировку вымогателей VantaCore, которая атакует российский бизнес с помощью собственного набора вредоносных инструментов. Известно как минимум о четырёх жертвах, а суммы требуемых выкупов исчисляются миллионами долларов.

По оценке «Эфшесть/F6», VantaCore может быть новым названием ранее известной проукраинской группировки Thor.

На связь указывают похожий дизайн чатов для переговоров с жертвами и иконка с рунической надписью THOR, найденная на сайте утечек. Сам ресурс появился не позднее 7 июня 2026 года.



Атакующие используют двойное и тройное вымогательство. Сначала они крадут данные, затем уничтожают резервные копии и шифруют критически важную информацию. Если компания не платит, похищенные материалы публикуют, продают или применяют для новых атак.


Для проникновения в инфраструктуру группа ищет слабозащищённые RDP- и VPN-сервисы, уязвимые публичные приложения и скомпрометированные учётные записи партнёров. Внутри сети злоумышленники перемещаются через SMB и RDP, используя легитимные аккаунты.

На заражённых Windows-системах они создают службы, устанавливают Tactical RMM и собственный бэкдор VantaCoreRAT. Для массовой доставки инструментов применяется авторский загрузчик VantaCoreLoader.

Перед запуском шифровальщика преступники останавливают защитные процессы с помощью AV/EDR-killer, после чего разворачивают программу-вымогатель VantaCore на серверах и рабочих станциях. Переговоры ведутся через чат в сети Tor, ссылка на который находится в записке с требованием выкупа.

Сама техника атаки, по мнению «Эфшесть/F6», не отличается особой изобретательностью. Зато набор инструментов полностью свой, а схема давления отлажена.

RSS: Новости на портале Anti-Malware.ru