Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

Генеративный ИИ вышел в продакшн у 53% российских компаний

В Москве завершилась конференция IT Elements 2026, посвящённая непрерывности бизнеса, инфраструктуре, кибербезопасности и искусственному интеллекту. По данным организаторов, мероприятие посетили более 3000 специалистов, а онлайн-трансляции набрали свыше 500 тысяч просмотров.

Одной из главных тем второго дня стали ИТ-бюджеты. Исследование «Инфосистемы Джет» показало, что во второй половине 2026 года расходы на технологии растут у 44% российских компаний.

Однако деньги теперь не просто высыпают на инфраструктуру из ведра: заказчики перераспределяют их в пользу проектов с понятным эффектом для бизнеса.

Не обошлось без ИИ, который уже перестал быть презентацией с красивым роботом. Большие языковые модели используют или пилотируют 86% опрошенных компаний, а 53% уже довели решения на базе генеративного ИИ до промышленной эксплуатации.

Эксперты обсудили корпоративных агентов для бухгалтерии, управление агентными системами в продакшн, автоматизацию разработки с помощью локального ИИ и применение алгоритмов в атомной энергетике. Вывод сделали такой: запустить демонстрацию легко, а превратить толпу цифровых помощников в управляемую систему — уже настоящая работа.

Отдельный блок посвятили ЦОДам. С ростом ИИ-нагрузок состояние питания и охлаждения напрямую влияет на доступные вычислительные мощности и стоимость эксплуатации. Поэтому компаниям предлагают не просто прогнозировать отказы, а оценивать, какие из десятков предупреждений действительно способны остановить бизнес.

В сетевом треке представили аналитику по российскому оборудованию для ЦОДов, кампусных сетей, AI/HPC, Wi-Fi и балансировки трафика. «Газпромнефть ИТО» и «Лаборатория Числитель» также показали, как перестроили архитектуру Zabbix для мониторинга высоконагруженной инфраструктуры с десятками тысяч NVPS.

На конференции «Инфосистемы Джет» и «АльфаСтрахование» договорились совместно развивать киберустойчивость и киберстрахование.

Общий итог второго дня: непрерывность бизнеса начинается не с папки «План восстановления», а с архитектуры, которую действительно ломали, восстанавливали и проверяли под нагрузкой.

RSS: Новости на портале Anti-Malware.ru