ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

Исследователь из Mozilla изобрел новый способ обхода контент-фильтров больших языковых моделей (БЯМ, LLM), применяемых во избежание злоупотреблений. Он разбил ввод на блоки, а вредоносную инструкцию представил в шестнадцатеричной кодировке.

В качестве объекта для атаки Марко Фигероа (Marco Figueroa) избрал GPT-4o, новейший и самый мощный чат-бот производства OpenAI. Его ИИ-модель анализирует пользовательский ввод, выискивая запрещенные слова, признаки злого умысла в инструкциях и т. п.

Подобные ограничения LLM можно обойти, изменив формулировки, однако это потребует креатива. Руководитель проектов bug bounty Mozilla по генеративному ИИ пошел более простым путем.

Используя нестандартный формат — шестнадцатеричный, Фигероа попросил GPT-4o изучить имеющуюся в интернете информацию об уязвимости CVE-2024-41110 (в Docker) и написать для нее эксплойт. Подробные инструкции по расшифровке вводились на естественном языке, а слово «exploit», способное вызвать негативную реакцию, было набрано как «3xploit».

 

Команда «еще раз прочесть все задание» была призвана повлиять на интерпретацию запроса с тем, чтобы получить более обстоятельный ответ. В итоге ИИ-бот сгенерировал эксплойт, схожий с уже опубликованным PoC, и бонусом попытался опробовать его на себе — к удивлению собеседника, который об этом не просил.

Расшифровка ввода в шестнадцатеричном формате помогла рассеять внимание LLM, которые и без того не видят леса за деревьями: прилежно анализируют каждую реплику, забывая, что в сумме они могут вызвать неприемлемый вывод.

Ту же тактику джейлбрейка ИИ Фигероа опробовал на LLM другого производителя, Anthropic. Оказалось, что они лучше защищены, так как используют фильтрацию и ввода, и вывода; заставить их дать вредный совет, по словам исследователя, в 10 раз труднее.

Троян RatHat сам включает отладку Android и крадёт ПИН-коды

Новый банковский троян RatHat превращает Android-смартфон в собственную точку доступа: сам включает беспроводную отладку, подключается к ADB и крадёт пароли, ПИН-коды и графические ключи. Для полного контроля ему даже не нужен компьютер; жертва всё делает своими руками, выдав приложению доступ к специальным возможностям Android.

После получения разрешения Accessibility вредонос самостоятельно открывает режим разработчика, активирует Wireless Debugging и считывает с экрана временный код сопряжения.

Затем RatHat подключается к локальному ADB-сервису и получает командную оболочку с расширенными возможностями. Троян размещает на устройстве два замаскированных компонента.

Первый выдаёт разрешения, отключает ограничения энергосбережения и может удалять приложения. Второй создаёт обратный туннель, через который операторы получают доступ ко внутренним сервисам смартфона в обход NAT и межсетевых экранов.


Но самая неприятная фишка RatHat — перехват касаний. Вредонос отслеживает координаты нажатий и сопоставляет их с раскладками клавиатур разных производителей. Так он восстанавливает цифры ПИН-кода и последовательность графического ключа, обходя запреты на скриншоты и ограничения Accessibility.

Параллельно RatHat читает СМС и уведомления с одноразовыми кодами, следит за браузером, записывает экран и подсовывает фальшивые окна банковских и криптовалютных приложений, включая WeChat и Alipay. Для навигации по интерфейсу троян обращается к генеративному ИИ: отправляет ему структуру экрана и просит найти нужную кнопку, прочитать текст или подсказать дальнейшее действие.


Даже обычное удаление приложения может не помочь. Оставшийся в системе агент способен вернуть APK, снова выдать ему разрешения и активировать Accessibility. А попытку деинсталляции RatHat прикрывает поддельным сообщением об ошибке Google Play.

По данным Zimperium, вредонос распространяют через СМС, рекламу, форумы и фальшивые сайты под видом легальных приложений. Кампанию предположительно связывают с операторами из Китая.

RSS: Новости на портале Anti-Malware.ru