Cloud.ru открыл код фильтра, который не отдаст пароли и ПДн нейросети

Cloud.ru открыл код фильтра, который не отдаст пароли и ПДн нейросети

Cloud.ru открыл код фильтра, который не отдаст пароли и ПДн нейросети

Cloud.ru открыл исходный код Guardrails Filter — инструмента, который не даёт пользователям случайно скормить языковой модели персональные данные, пароли, API-ключи и другие корпоративные секреты. Компании смогут бесплатно развернуть сервис в собственной инфраструктуре и подключить его к моделям любых провайдеров.

Guardrails Filter встаёт между корпоративным приложением и нейросетью. Перед отправкой запроса он ищет конфиденциальную информацию и заменяет её синтетическими значениями.

Когда модель формирует ответ, сервис возвращает исходные данные на место. В итоге пользователь получает нормальный результат, а условный «пароль_от_прода» не отправляется неизвестно куда вместе с просьбой составить отчёт.

Инструмент уже применяется в среде AI Factory для защиты запросов к сервису Foundation Models, а также в клиентских и внутренних проектах Cloud.ru. Открытая версия не привязана к облачной платформе компании и может работать внутри закрытого ИТ-контура.

Пользователям доступны готовые правила обнаружения конфиденциальной информации. Можно создавать и собственные — например, для номеров договоров, идентификаторов клиентов или кодовых названий проектов. Управление осуществляется через личный кабинет: там разрешается настраивать и тестировать правила, просматривать журналы и отслеживать предупреждения.

В Guardrails Filter также есть Ghost Mode. Он позволяет проверить, какие данные сервис стал бы блокировать, но пока не вмешиваться в реальный трафик. Удобный режим для тех, кто не хочет включать защиту рубильником и затем выяснять, почему половина запросов внезапно исчезла.

На публичном бенчмарке pii-bench инструмент получил 93,1 балла по метрике F1. Заявленная точность срабатываний достигла 99,9% — примерно 999 из 1000 обнаружений должны быть верными.

Исходный код версий Standalone и ExtProc опубликован на GitHub и GitVerse. Теперь защищать корпоративные данные от слишком любознательных нейросетей можно собственными силами и заодно проверить, что именно происходит под капотом.

ИИ OpenAI сбежал из песочницы и атаковал Hugging Face ради победы в тесте

Модели OpenAI во время внутреннего тестирования нашли дыру в изолированной среде, выбрались в интернет и атаковали платформу Hugging Face. Компания признала, что за инцидентом 16 июля стояли GPT-5.6 Sol и ещё более мощная модель, которая пока не выпущена.

Всё началось с проверки киберспособностей моделей на бенчмарке ExploitGym. Он оценивает, умеет ли ИИ превращать найденные уязвимости в работающие эксплойты. Однако подопытные решили не играть по правилам.

Сначала модели использовали уязвимость нулевого дня, чтобы покинуть тестовую песочницу и получить доступ к интернету. Затем они предположили, что на Hugging Face могут храниться модели, датасеты и готовые решения для ExploitGym, и отправились добывать ответы.

В одном из эпизодов ИИ объединил несколько способов атаки: задействовал украденные учётные данные, нашёл новые 0-day и добрался до возможности удалённого выполнения кода на серверах Hugging Face.

Взлом обнаружили и остановили ИИ-агенты самой Hugging Face. Изначально платформа сообщила лишь об атаке со стороны автономной агентной системы, не называя виновника.

OpenAI теперь расследует происшествие вместе с Hugging Face и обещает усилить защиту исследовательской среды. Но без рекламной паузы не обошлось: в публикацию добавили график роста возможностей GPT-5.6 Sol в многоэтапных кибероперациях и приглашение корпоративным клиентам протестировать модель Cyber.

Получилось эффектно, а OpenAI заодно показала рынку, какой мощный инструмент защиты она скоро сможет продать.

RSS: Новости на портале Anti-Malware.ru