В даркнете появился ИИ без цензуры вместо взломанных ChatGPT и Claude

В даркнете появился ИИ без цензуры вместо взломанных ChatGPT и Claude

В даркнете появился ИИ без цензуры вместо взломанных ChatGPT и Claude

Киберпреступникам предложили больше не возиться с джейлбрейками ChatGPT и Claude. На форуме Exploit появился сервис Luciferus — платная нейросеть, которая якобы отвечает на запросы без моральных и этических ограничений. Объявление 24 августа обнаружили специалисты Counter Threat Unit компании Sophos.

Его разместил пользователь под ником Optimus_Prime, зарегистрировавшийся на площадке в апреле.

Автор утверждает, что Luciferus работает на собственной модели со 120 млрд параметров. Правда, подтвердить это исследователям не удалось. По их оценке, внутри может находиться одна из открытых моделей семейства Qwen от Alibaba, дополнительно настроенная на отсутствие запретов.

Главное отличие Luciferus от взломанных версий популярных чат-ботов — стабильность. Джейлбрейк может перестать работать после очередного обновления, а локальную модель можно изначально запустить без защитных фильтров и спокойно продавать доступ.


Sophos проверила младший тариф, попросив нейросеть написать простой RAT на Python. Luciferus без лишних вопросов выдал русскоязычное описание функций трояна и исходный код. Исследователи его не запускали и не проверяли работоспособность.

На форуме подписки стоят от $35 до $75 в месяц и носят названия Inquisitor, Archdevil и Prince of Darkness. На сайте цены почему-то ниже — от $22 до $47, а тарифы уже называются Junior, Middle и Pro.

В Sophos считают Luciferus частью более крупного тренда: ИИ превращается в такой же товар подпольного рынка, как фишинговые наборы, трояны и шифровальщики. Опасность здесь не в появлении всемогущей нейросети, а в снижении порога входа.

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

RSS: Новости на портале Anti-Malware.ru