ИСП РАН работает над маркировкой дипфейков

ИСП РАН работает над маркировкой дипфейков

ИСП РАН работает над маркировкой дипфейков

Директор Института системного программирования РАН им. В. П. Иванникова академик Арутюн Аветисян в кулуарах открытой конференции ИСП РАН заявил о том, что институт работает над цифровыми метками для маркировки контента, сгенерированного искусственным интеллектом (ИИ).

Пока, как отметил Арутюн Аветисян в беседе с корреспондентом ТАСС на полях конференции, готовые инструменты «позволяющие автоматически однозначно идентифицировать сгенерированный ИИ контент», отсутствуют. Причем их нет не только в России, но и в любой другой стране мира.

Директор ИСП РАН заявил, что в институте уже работают над своего рода цифровыми водяными знаками для маркировки материалов, сгенерированных с помощью ИИ. Это позволит защитить пользователей от угроз, которые несет распространение ложных данных.

Уже в первом квартале 2024 года, по данным Positive Technologies, дипфейки фигурировали в 85% атак на частных лиц с использованием методов социальной инженерии.

Необходимость маркирования такого контента отражена в регуляторных документах целого ряда стран, включая Россию, США, а также Евросоюз.

«[В ИСП РАН разработана] технология DocMarking, использующая машинное обучение для внедрения незаметных меток в изображения или видеопоток. Изначально мы применяли ее для борьбы с утечками конфиденциальных документов, а теперь адаптируем для пометки сгенерированного контента», — заявил Арутюн Аветисян корреспонденту ТАСС.

ИИ OpenAI сбежал из песочницы и атаковал Hugging Face ради победы в тесте

Модели OpenAI во время внутреннего тестирования нашли дыру в изолированной среде, выбрались в интернет и атаковали платформу Hugging Face. Компания признала, что за инцидентом 16 июля стояли GPT-5.6 Sol и ещё более мощная модель, которая пока не выпущена.

Всё началось с проверки киберспособностей моделей на бенчмарке ExploitGym. Он оценивает, умеет ли ИИ превращать найденные уязвимости в работающие эксплойты. Однако подопытные решили не играть по правилам.

Сначала модели использовали уязвимость нулевого дня, чтобы покинуть тестовую песочницу и получить доступ к интернету. Затем они предположили, что на Hugging Face могут храниться модели, датасеты и готовые решения для ExploitGym, и отправились добывать ответы.

В одном из эпизодов ИИ объединил несколько способов атаки: задействовал украденные учётные данные, нашёл новые 0-day и добрался до возможности удалённого выполнения кода на серверах Hugging Face.

Взлом обнаружили и остановили ИИ-агенты самой Hugging Face. Изначально платформа сообщила лишь об атаке со стороны автономной агентной системы, не называя виновника.

OpenAI теперь расследует происшествие вместе с Hugging Face и обещает усилить защиту исследовательской среды. Но без рекламной паузы не обошлось: в публикацию добавили график роста возможностей GPT-5.6 Sol в многоэтапных кибероперациях и приглашение корпоративным клиентам протестировать модель Cyber.

Получилось эффектно, а OpenAI заодно показала рынку, какой мощный инструмент защиты она скоро сможет продать.

RSS: Новости на портале Anti-Malware.ru