Cloudflare: сбой вызвал некорректный файл из-за ошибки в правах БД

Cloudflare: сбой вызвал некорректный файл из-за ошибки в правах БД

Cloudflare: сбой вызвал некорректный файл из-за ошибки в правах БД

Стали известны подробности сбоя у Cloudflare: система Bot Management сгенерировала некорректный файл конфигурации. Он оказался слишком большим — в нём неожиданно появилось более 200 параметров вместо привычных ~60. Это превысило встроенный лимит и вызвало падение программного модуля, через который проходит трафик Cloudflare.

Напомним, у Cloudflare во вторник случился самый серьёзный сбой с 2019 года. Из-за ошибки в конфигурации баз данных часть глобальной сети компании перестала корректно обрабатывать трафик почти на шесть часов.

В результате множество сайтов и сервисов по всему миру были недоступны или работали с перебоями.

Виновный файл конфигурации был создан повторно из-за того, что обновлённые и не обновлённые узлы кластера возвращали разные метаданные. Каждые пять минут сеть переходила из рабочего состояния в аварийное, в зависимости от того, какая версия файла попадала на узлы.

Когда увеличенный файл начинал распространяться по инфраструктуре, модуль Bot Management, написанный на Rust, уходил в панику, вызывая массовые ошибки 5xx на сайтах.

Гендиректор Cloudflare Мэттью Принс подчеркнул, что речь не идёт о кибератаке:

«Проблема не была вызвана кибератакой или злонамеренной активностью. Всё началось с изменения прав одной из наших баз данных, что привело к генерации некорректного файла для системы Bot Management».

К 14:30 UTC инженеры вычислили причину и подменили проблемный файл на предыдущую корректную версию. Полностью все системы восстановили работу к 17:06 UTC. Сбой затронул CDN и сервисы безопасности, Turnstile, Workers KV, доступ к панели управления, почтовую защиту и механизмы аутентификации.

Принс назвал инцидент «неприемлемым»:

«Это был худший сбой Cloudflare с 2019 года… Мы приносим извинения клиентам и всему интернету. С учётом нашей роли в экосистеме любой простой недопустим».

Selectel упростил хранение аудит-логов и их передачу в SIEM

Selectel добавил автоматическую выгрузку аудит-логов в объектное хранилище. Теперь история действий в ИТ-инфраструктуре может отправляться в S3 практически без задержки — без самописных скриптов, внешних сервисов и регулярного ритуала «а логи у нас вообще сохранились?».

Функция пригодится компаниям, которым необходимо хранить записи о событиях безопасности до пяти лет.

Журналы можно складывать в централизованный архив, использовать при расследовании инцидентов и предъявлять во время аудитов.

Для выгрузки доступны фильтры по проектам, сервисам и типам событий. Пользователь может создать несколько правил: например, один поток направить в SIEM для оперативного анализа, а второй — в долгосрочный архив. Файлы получают метаданные и сохраняются в иерархической структуре, чтобы аналитическим системам не приходилось разгребать цифровой чердак.

Аудит-логи охватывают основные продукты Selectel, включая выделенные серверы, системы управления доступом IAM, Managed Kubernetes и DBaaS. Благодаря этому команды информационной безопасности и DevOps смогут работать с общей историей событий, а не собирать её по отдельным сервисам.

Совместимость с S3 также упрощает передачу данных в SIEM-системы. Провайдер рассчитывает, что автоматизация снизит нагрузку на специалистов, которым раньше приходилось самостоятельно разрабатывать и поддерживать механизмы экспорта.

Нынешнее обновление — только первый этап. Selectel планирует построить ETL-платформу для работы с логируемыми событиями, добавить потоковую выгрузку и прямые интеграции с популярными SIEM.

В итоге аудит-логи больше не должны лежать по разным углам инфраструктуры и исчезать именно тогда, когда началось расследование. Система соберёт их сама, разложит по хранилищу и подготовит к встрече с аналитиком или аудитором.

RSS: Новости на портале Anti-Malware.ru