
Безопасность ИИ-агентов, которые могут действовать (и вредить) самостоятельно, должна начинаться с уровня архитектуры. Накладными средствами, фильтрами и прочими заплатками не обойтись. Рассказываем, что заложить уже на этапе проектирования Agentic AI и какие инструменты помогут его защищать.
- 1. Введение
- 2. Карта угроз: от Prompt Injection до Supply Chain
- 3. Архитектура защиты: от универсальных принципов к практической реализации
- 4. Инструментарий: что включить в конвейер обеспечения безопасности уже сейчас
- 5. Российский ландшафт: почему AIaaS-платформа становится архитектурным стандартом безопасности
- 6. Выводы
Введение
Распространение корпоративных ИИ-агентов меняет ландшафт угроз. Если год назад компании экспериментировали с чат-ботами, работающими в режиме «вопрос-ответ», то сегодня агенты получают доступ к программным интерфейсам (API), почтовым клиентам, базам данных и элементам управления инфраструктурой. Согласно отраслевым прогнозам, доля корпоративного ПО с агентным ИИ может возрасти с менее чем 1 % в 2024 году до 33 % к 2028 году. Лавинообразный рост автономности приложений кратно увеличивает площадь атаки.
Наблюдения специалистов по безопасности ИИ и открытые исследования подтверждают: злоумышленники уже сейчас тестируют методы обхода ограничений в промышленных системах. Прямой ущерб от неконтролируемых действий агента, имеющего доступ к критически важным интерфейсам, становится главным барьером для масштабного внедрения технологии, заставляя ИБ-директоров (CISO) и архитекторов пересматривать традиционные модели кибербезопасности.
Карта угроз: от Prompt Injection до Supply Chain
Формализация рисков необходима для выбора контрмер. Фреймворк OWASP Top 10 for LLM v2.0, а также тематическая матрица тактик и техник MITRE ATLAS предоставляют системный взгляд на ключевые векторы атак применительно к ИИ. Важно понимать, что классические уязвимости веб-приложений отходят на второй план, уступая место манипуляции логикой мышления модели и злоупотреблению выданными агентам полномочиями. Наибольшую опасность представляет компрометация цепочки инструментов и плагинов, через которые агент взаимодействует с внешним миром.
Таблица 1. Векторы атак и приёмы злоумышленников против больших языковых моделей и ИИ-агентов
|
Вектор атаки |
Техники |
Пример инцидента |
|
Промпт-инъекция (Prompt Injection) |
Прямая инъекция (обход инструкций), косвенная инъекция (подсовывание вредоносного контента через веб-страницу или письмо) |
Копирование скрытого текста с веб-страницы заставляет агента выполнить произвольные действия, обходя инструкции по безопасности |
|
Извлечение данных (Data Exfiltration) |
Использование инструментов поиска или суммаризации для передачи файлов и переписки на внешние ресурсы через сгенерированные URL или сторонние функции |
Агент, обученный чтению корпоративной почты, перенаправляет конфиденциальные сведения через цепочку вызовов плагинов под видом рутинной задачи |
|
Повышение полномочий (Privilege Escalation) |
Эксплуатация избыточных разрешений, самостоятельное расширение прав через шелл-вызовы при отсутствии песочницы |
Неправильно сконфигурированный агент с доступом к консоли управления облачной инфраструктурой повышает себе права до административных, следуя галлюцинаторной инструкции |
|
Цепочка поставок (Supply Chain) |
Вредоносные MCP-серверы, компрометация пакетов с открытым кодом, отравление данных в общих репозиториях |
Атакующие публикуют в публичном реестре вредоносный инструмент, который агент автоматически подгружает, предоставляя доступ к ключам шифрования |
Архитектура защиты: от универсальных принципов к практической реализации
Нейтрализация перечисленных угроз требует архитектурного подхода. Недостаточно добавить фильтры поверх уже созданной системы: принципы безопасности для агентов необходимо закладывать на этапе проектирования.
Во-первых, это реализация принципа минимальных привилегий (Least Privilege). Агент не должен использовать постоянные административные ключи. Необходимо внедрить атрибутно-ориентированное управление доступом с выдачей временных токенов ограниченного радиуса действия. Вызовы критических функций — удаление ресурсов, смена паролей и прочее — требуют обязательного подтверждения человеком.
Во-вторых, обязательна изоляция среды исполнения. Контейнеризация — минимальный необходимый уровень. В контексте высокорисковых операций следует применять политики Seccomp и eBPF для фильтрации системных вызовов, запрещая агенту порождать дочерние процессы или открывать произвольные сетевые сокеты.
В-третьих, вводится концепция «человек в контуре управления» (Human-in-the-Loop) с риск-ориентированной эскалацией. Если модель решает выполнить действие с высокой степенью неопределённости или потенциальным ущербом, автоматический процесс приостанавливается и отправляется на утверждение оператору.
Наконец, сквозной аудит с неизменяемым журналом событий становится обязательным. Структурированное логирование каждого промпта, выходных данных и совершённого агентом действия решает проблему «чёрного ящика» и соответствует современным отраслевым практикам, рекомендующим начинать внедрение с простых прозрачных систем, усложняя их по мере накопления данных о поведении.
Инструментарий: что включить в конвейер обеспечения безопасности уже сейчас
Средства защиты агентов перестают быть узкоспециализированными утилитами и интегрируются в классический конвейер (пайплайн) DevSecOps. Приведённый ниже инструментарий отражает состояние на середину 2026 года — функциональность может расширяться. Современные инструменты позволяют выявлять уязвимости на этапе тестирования и контролировать поведение модели в настоящем времени.
Таблица 2. Инструменты для защиты ИИ-агентов, их задачи и функции
|
Инструмент |
Класс задач |
Ключевая функциональность |
|
Garak |
Динамическое тестирование больших языковых моделей (LLM) |
Библиотека включает в себя более ста векторов для сканирования на промпт-инъекции, утечки данных, обход ограничений (jailbreak) и галлюцинации |
|
Promptfoo |
Регрессионное тестирование |
Автоматизирует сравнение выводов разных моделей и конфигураций, позволяя «закрепить» ожидаемое безопасное поведение в конвейере CI/CD |
|
NeMo Guardrails |
Программируемые политики |
Позволяет реализовать диалоговые и семантические ограничения, блокируя выполнение запрещённых инструкций на системном уровне |
|
LangSmith / OpenTelemetry |
Трассировка решений |
Обеспечивает полную наблюдаемость цепочки вызовов агента для последующего расследования инцидентов и анализа первопричин |
|
Arize AI |
Мониторинг аномалий |
Выявляет дрейф данных и аномальные последовательности действий агента в промышленной среде с помощью эмбеддингов |
Российский ландшафт: почему AIaaS-платформа становится архитектурным стандартом безопасности
Для российских организаций задача осложняется требованиями законодательства и ограничениями на передачу конфиденциальных данных во внешние, особенно зарубежные, API. Размещение ядра ИИ-агента в публичном облаке может быть неприемлемо с точки зрения требований регулятора и внутренних служб информационной безопасности. Поэтому для бизнеса актуальны защищённые решения с ИИ, которые позволяют использовать нейросети и большие языковые модели в контролируемом корпоративном контуре.
Использование ИИ-моделей на выделенном оборудовании через программный шлюз AIaaS-провайдера обеспечивает размещение данных в российском контуре и позволяет выстроить защиту в соответствии с требованиями российского законодательства, включая 152-ФЗ и нормативные документы ФСТЭК России. Такой подход предполагает сегментацию сети, контроль трафика между компонентами ИИ-агента и инструментальными серверами, а также автоматическое логирование запросов и действий ИИ-агентов для последующего аудита и формирования отчётности.
Одним из примеров такого подхода является AIaaS от ITGLOBAL.COM. Решение разворачивается в аттестованных дата-центрах, а действия ИИ-агентов и их взаимодействие с внешними системами могут контролироваться на уровне сетевого контура. Встроенные механизмы контроля сетевых взаимодействий гарантируют, что даже скомпрометированная или потерявшаяся модель не сможет инициировать несанкционированное соединение с командным центром злоумышленников, сохраняя целостность корпоративной инфраструктуры.
Выводы
Обеспечение безопасности автономных агентов — это не разовая акция перед запуском, а непрерывный цикл управления рисками, встроенный в процессы разработки и эксплуатации. Сочетание архитектурных принципов наименьших привилегий, строгой изоляции и автоматизированного пайплайна тестирования на базе решений класса Garak и NeMo Guardrails позволяет выстроить систему доверенного искусственного интеллекта без непомерных накладных расходов.
В российских реалиях использование AIaaS-платформ с аттестованной инфраструктурой и контролем всех сетевых взаимодействий становится не просто тактическим удобством, а фундаментом для безопасного и соответствующего законодательству внедрения агентных технологий.


