Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

...
Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

Подпишитесь на новости

Meta* проверят на соблюдение закона об онлайн-безопасности в Британии

Исчезающие фотографии исчезают, а вопросы к их безопасности остаются. Британский регулятор Ofcom начал расследование в отношении Meta (корпорация Meta признана экстремистской и запрещена в России): ведомство выяснит, достаточно ли компания оценила риски перед запуском Instagram (принадлежит корпорации Meta, признанной экстремистской и запрещённой в России) Instants.

Как сообщил сам Ofcom, проверка касается соблюдения Online Safety Act. Регулятора интересуют угрозы распространения незаконного контента и риски для несовершеннолетних. Нарушение пока не установлено.

Функция Instants появилась в мае 2026 года и позволяет обмениваться изображениями, которые пропадают после просмотра. По британским правилам, перед существенными изменениями платформы компания должна обновить оценку рисков. Сначала разобраться, как новая функция может навредить пользователям, и только затем запускать.

Ofcom теперь проверит, была ли эта работа выполнена надлежащим образом. Ведомство сначала соберет доказательства, а при выявлении нарушения направит предварительное решение Meta. Компания сможет ответить на выводы до окончательного вердикта.

Если нарушение подтвердится, регулятор вправе потребовать исправлений и назначить штраф — до 18 млн фунтов или 10% соответствующей мировой выручки, в зависимости от того, какая сумма больше.

Meta заявила, что анализировала риски и общалась с Ofcom до запуска. По словам компании, в Instants предусмотрены запрет пересылки и защитные настройки подростковых аккаунтов. Теперь регулятору предстоит выяснить, достаточно ли этих мер и предшествующей оценки.

* Meta признана экстремистской организацией, ее деятельность запрещена в России

RSS: Новости на портале Anti-Malware.ru