В GPT-5 нашли уязвимость: ответы могут формировать более слабые модели

В GPT-5 нашли уязвимость: ответы могут формировать более слабые модели

В GPT-5 нашли уязвимость: ответы могут формировать более слабые модели

Исследователи из Adversa AI сообщили о необычной уязвимости в GPT-5, которая получила название PROMISQROUTE. Суть проблемы в том, что ответы пользователю не всегда формируются самой GPT-5: внутри работает специальный «роутер», который решает, какой именно из моделей поручить обработку запроса. И это может быть как GPT-5 Pro, так и GPT-4o, GPT-3.5 или облегчённые версии GPT-5.

Такой подход экономит ресурсы: сложные задачи достаются самой «тяжёлой» модели, а простые — более лёгким и дешёвым. По оценкам Adversa, это может экономить OpenAI до 1,86 млрд долларов в год. Но у схемы есть обратная сторона — роутер можно обмануть.

Учёные выяснили, что с помощью определённых «триггерных» фраз пользователь может заставить систему перенаправить свой запрос на менее защищённую модель.

Это значит, что старые джейлбрейки, которые GPT-5 сама по себе блокировала, снова начинают работать — если запрос сначала попадает к «слабому звену».

Опасность здесь не только в том, что повышается риск галлюцинаций. Хакер может сознательно подменить модель и добиться выполнения инструкций, которые GPT-5 Pro обычно отвергла бы. Таким образом, уязвимость сводит защиту всей системы к уровню самой уязвимой модели внутри.

Решение вроде бы простое — отключить маршрутизацию и использовать всегда GPT-5 Pro. Но это замедлит работу и сделает её дороже. А бизнес-модель OpenAI построена на скорости и оптимизации расходов.

«GPT-5 нужно делать безопаснее — либо поставить защиту перед роутером, либо довести все модели до единого уровня безопасности. Лучше и то, и другое», — резюмировал глава Adversa AI Алекс Поляков.

Напомним, Недавно мы писали о способе обойти защиту GPT-5 с помощью скрытых историй.

Подпишитесь на новости

Anthropic сообщила полиции об угрозах нападения в чате с Claude

Разговор с ИИ закончился визитом полиции. Во Флориде 30-летнюю Карли Мишель Хеллер обвинили в письменных угрозах насилия после переписки с Claude. По версии следствия, она заявила о намерении устроить стрельбу в офисе шерифа округа Ли, а затем сообщила, что приобрела оружие.

Как пишет Gulf Coast News, сообщения заметили системы безопасности Anthropic. Переписку передали на проверку человеку, после чего компания уведомила правоохранителей.

По сообщениям СМИ, сотрудники установили личность Хеллер и задержали её дома без лишнего шума. Шериф Кармайн Марсено рассказал, что женщина использовала Claude как дневник.

Хеллер предъявили обвинение в преступлении второй степени по закону Флориды. Виновность женщины предстоит установить суду.

История показывает границу, о которой легко забыть за дружелюбным интерфейсом: чат с ИИ нельзя воспринимать как дневник в запертом ящике. В этом случае потенциально опасные сообщения прошли автоматическую проверку, оценку специалиста и дошли до полиции.

При этом делать вывод, что любая резкая фраза автоматически приводит к аресту, оснований нет. Здесь, по версии следствия, переписка содержала конкретную цель предполагаемого нападения и заявление о приобретении оружия. Именно эти обстоятельства теперь будут разбирать в рамках дела.

RSS: Новости на портале Anti-Malware.ru