Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Команда Microsoft AI Red Team (AIRT) подытожила свой опыт тестирования 100 продуктов, созданных в компании на основе генеративного ИИ, и пришла к выводу, что обеспечение безопасности таких систем — нескончаемый процесс.

Из-за фундаментальных ограничений ИИ-моделей угрозы вроде инъекции стимула и джейлбрейка в этой сфере неистребимы.

Однако такие атаки можно сделать более затратными — как и в случае с другими ИТ-рисками, которые удается снизить, применяя, к примеру, тактику эшелонированной защиты (defense-in-depth) или следуя принципам конструктивной безопасности (security-by-design).

Делясь опытом, в Red Team также отметили (PDF), что для выстраивания защиты ИИ-системы важно понимать ее возможности и учитывать сферу применения. Так, большие языковые модели (БЯМ, LLM) склонны слепо следовать инструкциям пользователя, и их легко обмануть, спрятав вредоносный контент в большом объеме безобидного текста при вводе.

Также атака на ИИ-помощника по литературному творчеству вряд ли приведет к серьезным последствиям, а в случае с LLM, предназначенной для анализа историй болезни, может нанести вред здоровью пациентов и поставить крест на репутации медучреждения.

Чтобы заставить LLM выдать вредный совет, необязательно проводить градиентные состязательные атаки. Тот же эффект можно получить более дешевым способом, манипулируя интерфейсом либо введя в заблуждение модель языка и технического зрения.

 

Еще одно важное наблюдение, которым поделились специалисты: использование ИИ увеличивает существующие риски и создает новые.

Напомним, вопросы использования ИИ недавно обсуждались в ходе Открытой конференции Института системного программирования РАН им. В. П. Иванникова. Участники пленарной дискуссии сошлись во мнении, что внедрение ИИ-технологий тормозят проблемы доверия и безопасности таких сервисов.

Яндекс представил концепцию проверки ИИ на традиционные ценности

Яндекс представил правительственной рабочей группе концепцию национального набора тестов для проверки ИИ-систем на соответствие духовно-нравственным ценностям и российским условиям. Проект пока существует на уровне идеи, а окончательных решений по его устройству нет.

Предлагаемый датасет должен включать контрольные задания и эталонные данные, позволяющие сравнивать разные модели по единым критериям, сообщает «Коммерсантъ» со ссылкой на источники.

Обычно бенчмарки проверяют программирование, математику или решение рабочих задач. Теперь нейросетям могут добавить отдельный экзамен по духу времени — дисциплину, где списать правильный ответ будет особенно непросто.

Главный спор разгорелся вокруг публичности тестов. По сведениям источников, ФСБ выступает за закрытый формат: если разработчики заранее увидят вопросы, они смогут специально настроить модели на успешную сдачу.

Бизнес возражает, что полностью закрытая проверка замедлит выпуск новых версий и превратит тестирование в лотерею. В качестве компромисса обсуждается двухуровневая схема: открытый бенчмарк для предварительной настройки и закрытый — для финального экзамена по тем же темам, но с другими формулировками.

Не решено и то, кто будет определять содержание заданий. Представители ИТ-отрасли предлагают создать совместную комиссию из чиновников, бизнеса и экспертных организаций.

Дополнительная сложность заключается в самих критериях. В математике или программировании можно задать точный эталонный ответ. Со справедливостью, исторической памятью и другими ценностными категориями такой номер не пройдёт: здесь потребуется рубрикатор или экспертная оценка.

В аппарате вице-премьера Дмитрия Григоренко и Минцифры подтвердили, что предложения ещё обсуждаются. Яндекс публично концепцию не комментировал.

Напомним, ранее мы писали, что российские разработчики смогут передавать большие ИИ-модели в независимые испытательные лаборатории, которые проверят их на соответствие законодательству и традиционным духовно-нравственным ценностям.

Update:

Представители Яндекса добавили официальный комментарий:

«Яндекс не представлял концепцию национального датасета и набор тестов для проверки ИИ-моделей. На рабочей встрече в Минцифры представители нескольких компаний обсуждали возможные подходы к такой проверке. Яндекс был одним из участников обсуждения и высказал свою позицию – содержание датасета должно быть открытым по общепринятым принципам отрасли».

RSS: Новости на портале Anti-Malware.ru