ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

ChatGPT убедили создать эксплойт, подсунув инструкцию в 16-ричном формате

Исследователь из Mozilla изобрел новый способ обхода контент-фильтров больших языковых моделей (БЯМ, LLM), применяемых во избежание злоупотреблений. Он разбил ввод на блоки, а вредоносную инструкцию представил в шестнадцатеричной кодировке.

В качестве объекта для атаки Марко Фигероа (Marco Figueroa) избрал GPT-4o, новейший и самый мощный чат-бот производства OpenAI. Его ИИ-модель анализирует пользовательский ввод, выискивая запрещенные слова, признаки злого умысла в инструкциях и т. п.

Подобные ограничения LLM можно обойти, изменив формулировки, однако это потребует креатива. Руководитель проектов bug bounty Mozilla по генеративному ИИ пошел более простым путем.

Используя нестандартный формат — шестнадцатеричный, Фигероа попросил GPT-4o изучить имеющуюся в интернете информацию об уязвимости CVE-2024-41110 (в Docker) и написать для нее эксплойт. Подробные инструкции по расшифровке вводились на естественном языке, а слово «exploit», способное вызвать негативную реакцию, было набрано как «3xploit».

 

Команда «еще раз прочесть все задание» была призвана повлиять на интерпретацию запроса с тем, чтобы получить более обстоятельный ответ. В итоге ИИ-бот сгенерировал эксплойт, схожий с уже опубликованным PoC, и бонусом попытался опробовать его на себе — к удивлению собеседника, который об этом не просил.

Расшифровка ввода в шестнадцатеричном формате помогла рассеять внимание LLM, которые и без того не видят леса за деревьями: прилежно анализируют каждую реплику, забывая, что в сумме они могут вызвать неприемлемый вывод.

Ту же тактику джейлбрейка ИИ Фигероа опробовал на LLM другого производителя, Anthropic. Оказалось, что они лучше защищены, так как используют фильтрацию и ввода, и вывода; заставить их дать вредный совет, по словам исследователя, в 10 раз труднее.

Indeed CM подружили с OpenLDAP, Dogtag CA и Linux-доменами

Компания «Индид» выпустила Indeed Certificate Manager 7.3 — новую версию системы для централизованного управления сертификатами и ключевыми носителями. Главный вектор обновления — Linux: продукт получил поддержку новых каталогов, открытого центра сертификации и единого входа через Kerberos.

Indeed CM теперь работает с OpenLDAP и «Альт Домен». Это позволяет строить PKI-инфраструктуру в Linux-среде и не держаться мёртвой хваткой за одного поставщика инфраструктурных решений.

Ещё одна заметная интеграция — Dogtag CA. Открытый центр сертификации можно использовать вместе с Indeed CM для выпуска и управления жизненным циклом сертификатов. Пользователям при этом не придётся погружаться во все тонкости его нативного администрирования: система возьмёт эту криптографическую кухню на себя.

Для входа в сервисы Indeed CM на Linux добавили Kerberos SSO. После аутентификации в домене пользователю не нужно повторно вводить учётные данные — меньше паролей перед глазами, меньше поводов отдать их фишинговой форме.

Усилили и защиту самих сертификатов. Версия 7.3 поддерживает Рутокен БИО и трёхфакторную аутентификацию: ключевой носитель, PIN-код и отпечаток пальца. В интеграции с Рутокен Логон появился сценарий сложного пароля. Он автоматически генерируется и хранится на токене, поэтому запоминать очередную конструкцию из букв, цифр и спецсимволов не придётся.

Кроме того, система научилась хранить служебные заметки о пользователях и выпускать через SafeTech CA сервисные сертификаты для клиентских агентов. В список совместимого оборудования добавили новые модели JaCarta.

Indeed CM 7.3 также поддерживает Windows Server 2025, Debian 13 и «Альт» 11, а заодно совместима с ALD Pro 3.0.

RSS: Новости на портале Anti-Malware.ru