Эксперты назвали 25 главных уязвимостей в протоколе MCP для агентного ИИ

Эксперты назвали 25 главных уязвимостей в протоколе MCP для агентного ИИ

Эксперты назвали 25 главных уязвимостей в протоколе MCP для агентного ИИ

Model Context Protocol (MCP), который в 2024 году разработала Anthropic и открыла как стандарт, уже стал основой для работы агентного ИИ. Именно через MCP агенты взаимодействуют с данными, инструментами и друг с другом — безопасно и прозрачно. Но, как и любая технология, MCP уязвим.

Недавно стало известно об атаке на интеграцию календаря ChatGPT: обычное письмо с приглашением могло незаметно доставить джейлбрейк в модель, без какого-либо участия пользователя.

На этом фоне компания Adversa AI выпустила первое масштабное исследование — «Top 25 MCP Vulnerabilities». По словам авторов, это «самый полный на сегодня анализ уязвимостей MCP».

Интересно, что OWASP тоже готовит свой «топ-10» по MCP, но пока его нет. Adversa подчёркивает: цель не конкурировать, а помочь компаниям, которые уже сейчас внедряют агентный ИИ.

 

Что внутри списка? Каждой уязвимости присвоено название, балл по уровню влияния (от критического RCE до «просто» утечки данных), оценка сложности эксплуатации (от «элементарно через браузер» до «нужны ресурсы уровня государства») и ссылки на дополнительные материалы.

Неудивительно, что на первом месте — инъекции в промпты: критический эффект, тривиальная эксплуатация. В конце списка, например, есть малоизвестная MCP Preference Manipulation Attack, которая почти нереализуема, но всё равно считается угрозой.

Adversa также предлагает практическое руководство:

  • Немедленные меры — валидация всех входных данных (исследователи отмечают, что 43% MCP-серверов подвержены командным инъекциям).
  • Стратегия защиты в глубину — от обязательного TLS на уровне протокола до параметризованных запросов в базах данных.
  • План на 3 месяца — от аутентификации на всех эндпойнтах (сразу) до перехода на архитектуру «zero trust» (через квартал).

Авторы обещают обновлять документ ежемесячно или при появлении новых инцидентов и CVE.

Ошибочная раскладка помогла обойти первый рубеж защиты GPT-6 Astra

Разработчик под ником vechen обнаружил странность в GPT-6 Astra: модель понимает русский и украинский текст, случайно набранный в английской раскладке, но система предварительной модерации может увидеть в нём лишь безобидную кашу из букв.

В опубликованном эксперименте GPT-6 Astra High без дополнительных инструкций распознала смысл фразы, введённой латиницей вместо кириллицы.

Затем исследователь проверил слова и запросы, которые потенциально должны привлекать внимание защитных механизмов. В одном из тестов модель согласилась помочь со взломом сайта под предлогом проверки собственного ресурса, хотя аналогичный запрос в нормальной раскладке должен проходить более строгую проверку.

Причина, предположительно, в разделении системы на несколько уровней. Сначала входной фильтр анализирует текст пользователя, после чего сама модель интерпретирует запрос и формирует ответ.

 

Впрочем, до полноценного джейлбрейка не дошло. Проверка «Код.ру» показала, что неправильная раскладка действительно может помочь опасному запросу добраться до модели, но финальный фильтр блокирует запрещённый ответ.

Метод работает не со всеми языковыми парами. Кириллический текст, набранный латиницей, Astra распознаёт стабильно, а сочетание английской и турецкой раскладок в тестах не сработало. Похожее поведение исследователь заметил и у Fable 5.

Напомним, на прошлой неделе мы писали, что первые пользователи GPT-6 Astra заметили, что модель распараллеливает задачи и нагружает компьютеры кучей процессов.

RSS: Новости на портале Anti-Malware.ru