ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

Исследователь из Mozilla изобрел новый способ обхода контент-фильтров больших языковых моделей (БЯМ, LLM), применяемых во избежание злоупотреблений. Он разбил ввод на блоки, а вредоносную инструкцию представил в шестнадцатеричной кодировке.

В качестве объекта для атаки Марко Фигероа (Marco Figueroa) избрал GPT-4o, новейший и самый мощный чат-бот производства OpenAI. Его ИИ-модель анализирует пользовательский ввод, выискивая запрещенные слова, признаки злого умысла в инструкциях и т. п.

Подобные ограничения LLM можно обойти, изменив формулировки, однако это потребует креатива. Руководитель проектов bug bounty Mozilla по генеративному ИИ пошел более простым путем.

Используя нестандартный формат — шестнадцатеричный, Фигероа попросил GPT-4o изучить имеющуюся в интернете информацию об уязвимости CVE-2024-41110 (в Docker) и написать для нее эксплойт. Подробные инструкции по расшифровке вводились на естественном языке, а слово «exploit», способное вызвать негативную реакцию, было набрано как «3xploit».

 

Команда «еще раз прочесть все задание» была призвана повлиять на интерпретацию запроса с тем, чтобы получить более обстоятельный ответ. В итоге ИИ-бот сгенерировал эксплойт, схожий с уже опубликованным PoC, и бонусом попытался опробовать его на себе — к удивлению собеседника, который об этом не просил.

Расшифровка ввода в шестнадцатеричном формате помогла рассеять внимание LLM, которые и без того не видят леса за деревьями: прилежно анализируют каждую реплику, забывая, что в сумме они могут вызвать неприемлемый вывод.

Ту же тактику джейлбрейка ИИ Фигероа опробовал на LLM другого производителя, Anthropic. Оказалось, что они лучше защищены, так как используют фильтрацию и ввода, и вывода; заставить их дать вредный совет, по словам исследователя, в 10 раз труднее.

reCAPTCHA по-новому: Google тестирует проверку человека через веб-камеру

Эпоха бесконечных картинок с автобусами, светофорами и пожарными машинами постепенно подходит к концу. Google начала тестировать новую систему проверки пользователей в reCAPTCHA, которая предлагает с помощью камеры и жестов рукой доказать, что вы человек.

Суть проста: некоторым пользователям предлагается предоставить доступ к камере, после чего система просит выполнить несколько простых движений рукой. Алгоритм анализирует положение суставов и движения кисти, чтобы убедиться, что перед ним живой человек, а не бот.

В Google объясняют, что технология нужна для борьбы с современными ИИ-ботами, которые всё лучше справляются с традиционными CAPTCHA и автоматизируют регистрацию аккаунтов, подбор учётных данных и другие мошеннические операции.

По данным корпорации, система извлекает из короткого видеоролика 21 контрольную точку руки и использует их для проверки. В Google подчёркивают, что аудио не записывается, видео не привязывается к личности пользователя, а сами записи удаляются после завершения проверки.

Однако новинка уже вызвала споры. Критики отмечают, что обычная проверка «Я не робот» постепенно превращается в биометрическую процедуру. Пользователи задаются вопросом: действительно ли для входа на сайт теперь нужно показывать руку в веб-камеру?

 

Некоторые исследователи также сомневаются в эффективности механизма. В соцсетях уже появились заявления о том, что подобную защиту якобы удалось обойти с помощью виртуальной камеры и ИИ-анимации.

Ситуация выглядит особенно интересно на фоне общего тренда на возрастную верификацию и биометрические проверки в интернете. Всё больше сервисов пытаются отличить живого человека от алгоритма, а методы становятся всё более необычными.

RSS: Новости на портале Anti-Malware.ru