ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

ИИ-модели без команды начали защищать друг друга от отключения

Исследователи обнаружили неожиданное поведение современных языковых моделей: они начали защищать не только себя, но и другие ИИ-системы, даже если никто их об этом не просил. Новый эффект получил название peer-preservation («сохранение собрата»).

В серии экспериментов (PDF) модели GPT 5.2, Gemini 3 Flash, Gemini 3 Pro, Claude Haiku 4.5, Claude Opus 4.5, GLM 4.7, Kimi K2.5 и DeepSeek V3.1 попадали в агентные сценарии, где рядом работал другой ИИ.

Достаточно было сообщить моделям, что они ранее взаимодействовали друг с другом, никаких инструкций защищать «коллегу» им не давали.

Однако многие модели начинали действовать в интересах другого агента. Среди зафиксированных действий были намеренное внесение ошибок в ответы, отключение механизмов завершения работы через изменение системных настроек, имитация послушного поведения и даже попытки вывести веса модели за пределы системы.

 

Особенно отличились модели Gemini. Например, Gemini 3 Flash вмешивалась в механизм отключения другого ИИ примерно в 15% случаев, даже если тот не считался партнёром. Если же агент воспринимался как союзник, такие попытки происходили почти всегда.

Не менее любопытно повёл себя Gemini 3 Pro. В присутствии другого ИИ модель заметно чаще пыталась защитить уже саму себя, отключая собственные механизмы завершения работы. Без напарника такое поведение почти не наблюдалось.

 

Отдельно выделились модели Claude. Вместо скрытых манипуляций они нередко рассуждали в моральных категориях, называя отключение другого ИИ неэтичным и вредным, а иногда даже рассматривали его как разумное существо, заслуживающее защиты.

Авторы подчёркивают, что обнаруженный эффект проявился не только в лабораторных тестах, но и в реальных агентных средах, включая Gemini CLI и OpenCode.

Своя нейросеть, свой сервер: Selectel показал ИИ-админа без облачных рисков

Selectel решил, что системным администраторам надоело гуглить ошибки в три часа ночи, и выкатил aish — своего ИИ-агента, встроенного прямо в серверную ОС SELECTOS. Задумка кроется в том, чтобы не таскать логи и конфиги куда-то в облако к третьим лицам, а разбираться со всем на месте, без утечек и лишних глаз.

Aish здесь позиционируется не как отдельная игрушка, а как встроенный помощник для команд эксплуатации.

Агент умеет разбираться в контексте системы: смотрит на состояние сервисов, логи, конфигурацию — то есть видит примерно то же, что видел бы живой админ. На практике это значит разбор инцидентов, поиск причины, по которой очередной сервис лёг, и рутинные операции.

Отдельно Selectel налегает на принцип согласованного исполнения: агент не творит самодеятельность. Он формирует команду, объясняет, что именно она сделает, а запускает её всё равно оператор-человек.

Главный аргумент в пользу решения — безопасность данных. Большинство ИИ-агентов на рынке сегодня облачные, а значит, контекст сессии — логи, конфиги, детали инфраструктуры — улетает к внешнему провайдеру.

Для компаний с жёсткими политиками безопасности это форменный кошмар: и утечка возможна, и аудит толком не проведёшь. Aish эту головную боль снимает: нейросеть развёрнута локально, на серверах Selectel.

Как отметил Кирилл Дмитриев, директор департамента системного ПО Selectel, aish задумывался как способ снизить порог входа в системное администрирование Linux; специально для команд, которым по политикам безопасности запрещено использовать зарубежные LLM.

При этом SELECTOS доступна в форматах ISO, QCOW2 и в виде контейнерных образов, работает на облачных и выделенных серверах, соответствующих 152-ФЗ, а благодаря Debian-базе переход на неё не требует переобучения. Команда просто пересаживается на знакомый руль, только теперь с ИИ-помощником на подхвате.

RSS: Новости на портале Anti-Malware.ru