ФСТЭК России готовит стандарт безопасной разработки систем ИИ

ФСТЭК России готовит стандарт безопасной разработки систем ИИ

ФСТЭК России готовит стандарт безопасной разработки систем ИИ

Выступая на BIS Summit 2025, первый замдиректора ФСТЭК России Виталий Лютиков сообщил, что регулятор планирует до конца года вынести на обсуждение проект стандарта привнесения аспекта безопасности в разработку ИИ-систем.

Новое методическое руководство будет представлено как дополнение к действующим нормативам по безопасной разработке программного обеспечения, в том числе ГОСТ Р 56939-2024.

У ИИ-моделей есть своя специфика с точки зрения ИБ — склонность к галлюцинациям, риск утечки конфиденциальных данных и злоупотреблений через манипуляцию промптами, возможность вмешательства в алгоритмы машинного обучения, и ее следует учитывать при создании подобных инструментов.

Приказ ФСТЭК России № 117 от 11.04.2025 об усилении защиты данных в ГИС (заработает с 1 марта будущего года) содержит раздел об ИИ-технологиях, однако изложенные в нем требования по безопасности ограничены эксплуатацией.

Вместе с тем, как и в случае с обычным софтом, не менее важно обезопасить ИИ-системы еще на стадии разработки (такой подход известен как security by design). Новая инициатива регулятора призвана восполнить этот пробел.

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

RSS: Новости на портале Anti-Malware.ru