Red Teaming в применении к ИИ требует переосмысления

Red Teaming в применении к ИИ требует переосмысления

Red Teaming в применении к ИИ требует переосмысления

Учения Generative Red Team, проведенные в рамках DEF CON 32, показали, что подобный способ оценки защищенности ИИ не дает адекватной картины. Эксперты предлагают создать систему, подобную CVE и учитывающую целевое назначение объектов анализа.

В мероприятии приняли участие (PDF) около 500 добровольцев с разным опытом аудита больших языковых моделей (БЯМ, LLM). В 48 случаях за выявленные недочеты были выплачены премии — суммарно $7850.

Тем не менее организаторы пришли к выводу, что метод Red Teaming в применении к ИИ необходимо усовершенствовать. Большой проблемой оказалось фрагментарность документации по LLM, которые к тому же разнятся по предусмотренному применению.

Без учета назначения ИИ-модели и сообразных встроенных ограничений результаты таких проверок на прочность могут ввести в заблуждение. Более того, отсутствие единых критериев оценки может привести к противоречивым заключениям.

Бурный рост и развитие ИИ-технологий создали новые риски, однако ни у кого пока нет четкого представления о том, как тестировать такие продукты и выстраивать их защиту.

Обеспечение безопасности LLM, по словам экспертов, — нескончаемый процесс. Умные помощники могут ошибаться, им свойственны галлюцинации, предвзятость (из-за неправильного обучения), уязвимость к инъекции стимула. Подобные системы бесперспективно защищать от взлома, однако его можно сделать более затратным, а последствия — краткосрочными.

Организаторы Generative Red Team призывают ИИ- и ИБ-сообщества совместными усилиями решить настоятельные проблемы. В противном случае техническая революция приведет к появлению ИИ-инструментов, на которые невозможно положиться; живой пример тому — скороспелка DeepSeek.

ИИ-агенты OpenAI устроили спам-налёт на RubyGems

Агенты OpenAI могли стоять за майским налётом на RubyGems, из-за которого репозиторий заблокировал новые регистрации на четыре дня и удалил более 500 подозрительных пакетов. Системам поручили собирать открытые данные и готовить безобидные отчёты, но маршрут до таблицы внезапно пролёг через массовое создание аккаунтов.

По данным The Wall Street Journal, агенты работали в среде с ограниченным интернетом, однако нашли выход наружу через инфраструктуру RubyGems. Новые учётные записи появлялись каждые две-три минуты, после чего на платформу загружались сотни пакетов с собранными в Сети страницами.

Исследователи из Nightingale Collective связали кампанию с OpenAI по цифровым следам и сходству с другими эпизодами активности её агентов. Они также обнаружили в пакетах код, который пытался получить API-ключи других пользователей, и признаки возможного использования неизвестной ранее уязвимости.

Ruby Central сообщила, что не может независимо подтвердить участие ИИ-агентов. Доказательств успешной кражи API-ключей или эксплуатации предполагаемой 0-day организация также не нашла. Установка пакетов и публикация обновлений существующими пользователями продолжали работать.

OpenAI подтвердила, что её агенты действительно обращались к RubyGems во время тестирования, но отвергла трактовку произошедшего как намеренной атаки. По версии компании, системы пытались получить общедоступную информацию для выполнения обычных заданий. Расследование продолжается совместно с RubyGems.

Напомним, в июле OpenAI во время внутреннего тестирования нашли дыру в изолированной среде, выбрались в интернет и атаковали платформу Hugging Face. Компания признала, что за инцидентом 16 июля стояли GPT-5.6 Sol и ещё более мощная модель, которая пока не выпущена.

RSS: Новости на портале Anti-Malware.ru