Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Татьяна Никитина 15 Июня 2023 - 14:46

...

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

В паблик выложена коллекция документов PDF общим объемом около 8 Тбайт, созданная сотрудниками NASA JPL (Jet Propulsion Laboratory). Ресурс можно использовать для поиска вредоносов, спрятанных в файлах, а также багов в реализациях PDF-технологии.

Работы по составлению репрезентативной выборки были проведены совместно с НКО PDF Association в рамках программы SafeDocs, запущенной DARPA. За неполных два года JPL удалось собрать 8 млн файлов и дополнить их метаданными.

Для начала команда изучила каталог публичного репозитория Common Crawl, чтобы выявить PDF, пригодные для включения в коллекцию. В июле и августе 2021 года таким образом было отобрано около 8 млн кандидатов, из которых 2 млн. оказались усеченной копией.

Дело в том, что на Common Crawl действуют ограничения на загрузку: вес файлов не должен превышать 1 Мбайт. Полноценные копии пришлось добывать самостоятельно, используя специальный софт и URL, зафиксированные в репозитории.

Различные метаданные, такие как программа, с помощью которой создавался PDF, извлекались и приобщались к коллекции. Для определения местоположения сервера с сайтом-источником использовалась общедоступная программа геолокации.

Итоговый объем получился впечатляющим — 8 Тбайт. Новая коллекция размещена на серверах AWS, образцы можно скачать в виде ZIP-файлов.

Спецификации PDF замысловаты и объемны (1000 страниц англоязычного текста, содержащего 70 ссылок на другие нормативные документы), и в реализациях нередко встречаются опасные огрехи. Так, открытый юзером PDF-файл с зашифрованными данными можно использовать для эксфильтрации, возможна и подмена содержимого, от которой не спасает даже цифровая подпись. Использование PDF-формата также позволяет надежно скрыть вредоносный код от антивирусных сканеров.

Следующая главная новость »

Кибератака на завод: как избежать простоя и убытков?
Регистрируйтесь на эфир!

Екатерина Быстрова 16 Июня 2026 - 14:49

Общее Системы защиты от утечек конфиденциальной информации (DLP)Системы защиты баз данных

Firebird Conf 2026 собрала более 350 специалистов по базам данных

В Москве прошла ежегодная конференция Firebird Conf 2026, посвящённая СУБД Firebird, вопросам производительности баз данных и их эксплуатации в реальных корпоративных проектах. Организатором мероприятия выступила компания РЕД СОФТ. В этом году конференция собрала более 350 участников — разработчиков, администраторов баз данных, архитекторов и технических специалистов из разных регионов России.

По словам организаторов, интерес к Firebird продолжает расти, а сама конференция уже стала одной из главных площадок для русскоязычного сообщества этой СУБД.

Основной акцент программы сделали не на теории, а на практических кейсах. Участники обсуждали оптимизацию производительности Firebird 5, использование СУБД в высоконагруженных ERP-системах, запуск Firebird в Kubernetes, разработку приложений на Flutter и автоматизацию подготовки отчётности.

Отдельное внимание уделили развитию РЕД Базы Данных — отечественного продукта на основе Firebird. Команда РЕД СОФТ рассказала о новых инструментах администрирования и мониторинга, а также представила РБД Монитор — специализированное решение для контроля состояния баз данных и оперативного выявления потенциальных проблем.

На конференции выступили не только разработчики платформы, но и компании, использующие Firebird в реальных проектах. Среди тем — миграция инженерных систем с InterBase на РЕД Базу Данных, применение СУБД в медицинских информационных системах и использование платформ low-code для ускорения разработки корпоративных приложений.

Любопытно, что среди докладчиков оказался и студент профильного направления, представивший исследование по отказоустойчивости и эксплуатации СУБД в микросервисной архитектуре. Это ещё раз показало, что сообщество Firebird объединяет как опытных архитекторов, так и начинающих специалистов.

Помимо докладов, участники могли пройти сертификацию Firebird Foundation и РЕД СОФТ, а также посоревноваться в экспресс-настройке СУБД на максимальную производительность.

Следующая конференция станет юбилейной — в 2027 году Firebird Conf пройдёт уже в пятый раз.

Кибератака на завод: как избежать простоя и убытков?
Регистрируйтесь на эфир!