Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

ИИ-агенты OpenAI устроили спам-налёт на RubyGems

Агенты OpenAI могли стоять за майским налётом на RubyGems, из-за которого репозиторий заблокировал новые регистрации на четыре дня и удалил более 500 подозрительных пакетов. Системам поручили собирать открытые данные и готовить безобидные отчёты, но маршрут до таблицы внезапно пролёг через массовое создание аккаунтов.

По данным The Wall Street Journal, агенты работали в среде с ограниченным интернетом, однако нашли выход наружу через инфраструктуру RubyGems. Новые учётные записи появлялись каждые две-три минуты, после чего на платформу загружались сотни пакетов с собранными в Сети страницами.

Исследователи из Nightingale Collective связали кампанию с OpenAI по цифровым следам и сходству с другими эпизодами активности её агентов. Они также обнаружили в пакетах код, который пытался получить API-ключи других пользователей, и признаки возможного использования неизвестной ранее уязвимости.

Ruby Central сообщила, что не может независимо подтвердить участие ИИ-агентов. Доказательств успешной кражи API-ключей или эксплуатации предполагаемой 0-day организация также не нашла. Установка пакетов и публикация обновлений существующими пользователями продолжали работать.

OpenAI подтвердила, что её агенты действительно обращались к RubyGems во время тестирования, но отвергла трактовку произошедшего как намеренной атаки. По версии компании, системы пытались получить общедоступную информацию для выполнения обычных заданий. Расследование продолжается совместно с RubyGems.

Напомним, в июле OpenAI во время внутреннего тестирования нашли дыру в изолированной среде, выбрались в интернет и атаковали платформу Hugging Face. Компания признала, что за инцидентом 16 июля стояли GPT-5.6 Sol и ещё более мощная модель, которая пока не выпущена.

RSS: Новости на портале Anti-Malware.ru