Российские учёные научили ИИ ловить фейковые фото и нелепые изображения

Российские учёные научили ИИ ловить фейковые фото и нелепые изображения

Российские учёные научили ИИ ловить фейковые фото и нелепые изображения

Исследователи из AIRI, Сколтеха, MWS AI и МФТИ по-новому решили одну из наиболее сложных задач компьютерного зрения — выявление изображений с нелогичным содержанием, вроде рыцаря с мобильником или пингвина на велосипеде.

Разработанный ими метод TLG (Through the Looking Glass, «В Зазеркалье») использует ИИ для создания текстовых описаний картинок и обнаружения противоречий при сопоставлении с визуальным содержанием.

В комментарии для «Известий» один из соавторов проекта, доктор компьютерных наук Александр Панченко пояснил: существующие ИИ-модели хорошо распознают элементы картинок, но плохо улавливают контекст — далеко не всегда понимают совместимость представленных объектов с точки зрения здравого смысла.

Чтобы проверить действенность своего подхода, экспериментаторы создали датасет, включив него 824 изображения с нелепыми ситуациями. Тестирование алгоритма показало точность распознавания до 87,5%, что на 0,5-15% выше показателей других существующих моделей, а также большую экономию вычислительных ресурсов.

Новаторская разработка, по словам Панченко, способна повысить надежность систем компьютерного зрения. После доработки и дообучения ее также можно будет использовать для модерации контента — к примеру, для выявления фейковых фото.

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

RSS: Новости на портале Anti-Malware.ru