Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Microsoft: системы на базе ИИ никогда не станут абсолютно безопасными

Команда Microsoft AI Red Team (AIRT) подытожила свой опыт тестирования 100 продуктов, созданных в компании на основе генеративного ИИ, и пришла к выводу, что обеспечение безопасности таких систем — нескончаемый процесс.

Из-за фундаментальных ограничений ИИ-моделей угрозы вроде инъекции стимула и джейлбрейка в этой сфере неистребимы.

Однако такие атаки можно сделать более затратными — как и в случае с другими ИТ-рисками, которые удается снизить, применяя, к примеру, тактику эшелонированной защиты (defense-in-depth) или следуя принципам конструктивной безопасности (security-by-design).

Делясь опытом, в Red Team также отметили (PDF), что для выстраивания защиты ИИ-системы важно понимать ее возможности и учитывать сферу применения. Так, большие языковые модели (БЯМ, LLM) склонны слепо следовать инструкциям пользователя, и их легко обмануть, спрятав вредоносный контент в большом объеме безобидного текста при вводе.

Также атака на ИИ-помощника по литературному творчеству вряд ли приведет к серьезным последствиям, а в случае с LLM, предназначенной для анализа историй болезни, может нанести вред здоровью пациентов и поставить крест на репутации медучреждения.

Чтобы заставить LLM выдать вредный совет, необязательно проводить градиентные состязательные атаки. Тот же эффект можно получить более дешевым способом, манипулируя интерфейсом либо введя в заблуждение модель языка и технического зрения.

 

Еще одно важное наблюдение, которым поделились специалисты: использование ИИ увеличивает существующие риски и создает новые.

Напомним, вопросы использования ИИ недавно обсуждались в ходе Открытой конференции Института системного программирования РАН им. В. П. Иванникова. Участники пленарной дискуссии сошлись во мнении, что внедрение ИИ-технологий тормозят проблемы доверия и безопасности таких сервисов.

ИИ ускоряет умных и топит доверчивых: эксперимент раскрыл цену ChatGPT

Доступ к ИИ-советнику на базе GPT-4 по-разному повлиял на владельцев малого бизнеса в Кении. Наиболее успешные предприниматели увеличили прибыль на 15%, а менее подготовленные потеряли около 10% дохода, выяснили исследователи Калифорнийского университета в Беркли, Гарварда и Колумбийского университета.

Эксперимент продолжался шесть месяцев. Сильные участники не воспринимали рекомендации модели как готовые команды, а адаптировали их к реальным условиям.

Например, закупали генераторы для работы во время отключений электричества или расширяли набор услуг.

Предприниматели с более слабыми навыками чаще применяли шаблонные советы без проверки. Рекомендация снизить цены могла выглядеть убедительно в окне чат-бота, но на практике уменьшала выручку. GPT-4 в таком случае выступал не бизнес-консультантом, а очень уверенным генератором убытков.

Проблема, по мнению исследователей, заключается не столько в технологии, сколько в отказе пользователя от критического мышления. Ранее эксперимент колледжа Дикинсона показал, что 97% участников скопировали заведомо неверный ответ ChatGPT даже при решении простой задачи. Группа без ИИ справилась лучше. Однако обычное напоминание проверить результат сразу удвоило точность.

Анализ 1,4 млн рабочих сессий KPMG дал похожую картину. Около 95% пользователей обращаются с ИИ как с торговым автоматом: запрашивают черновик или краткое содержание и забирают первый результат. Только 5% используют модель как партнёра по мышлению: задают контекст, направляют рассуждение и спорят с ответами.

Для компаний это означает, что сама доля сотрудников с доступом к ИИ почти ничего не говорит об эффективности внедрения. Универсальная инструкция тоже может навредить: разные задачи требуют разного уровня контроля. Нейросеть способна ускорить сильного специалиста и убедительно завести слабого не туда.

RSS: Новости на портале Anti-Malware.ru