Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

В паблик выложена коллекция документов PDF общим объемом около 8 Тбайт, созданная сотрудниками NASA JPL (Jet Propulsion Laboratory). Ресурс можно использовать для поиска вредоносов, спрятанных в файлах, а также багов в реализациях PDF-технологии.

Работы по составлению репрезентативной выборки были проведены совместно с НКО PDF Association в рамках программы SafeDocs, запущенной DARPA. За неполных два года JPL удалось собрать 8 млн файлов и дополнить их метаданными.

Для начала команда изучила каталог публичного репозитория Common Crawl, чтобы выявить PDF, пригодные для включения в коллекцию. В июле и августе 2021 года таким образом было отобрано около 8 млн кандидатов, из которых 2 млн. оказались усеченной копией.

Дело в том, что на Common Crawl действуют ограничения на загрузку: вес файлов не должен превышать 1 Мбайт. Полноценные копии пришлось добывать самостоятельно, используя специальный софт и URL, зафиксированные в репозитории.

Различные метаданные, такие как программа, с помощью которой создавался PDF, извлекались и приобщались к коллекции. Для определения местоположения сервера с сайтом-источником использовалась общедоступная программа геолокации.

Итоговый объем получился впечатляющим — 8 Тбайт. Новая коллекция размещена на серверах AWS, образцы можно скачать в виде ZIP-файлов.

Спецификации PDF замысловаты и объемны (1000 страниц англоязычного текста, содержащего 70 ссылок на другие нормативные документы), и в реализациях нередко встречаются опасные огрехи. Так, открытый юзером PDF-файл с зашифрованными данными можно использовать для эксфильтрации, возможна и подмена содержимого, от которой не спасает даже цифровая подпись. Использование PDF-формата также позволяет надежно скрыть вредоносный код от антивирусных сканеров.

Путин: ограничения мобильного интернета решат переходом на российское ПО

Владимир Путин прокомментировал ограничения работы мобильного интернета в российских регионах и объяснил, как, по его мнению, эту проблему можно решить. Тема прозвучала на прямой линии с президентом, которую сегодня смотрит вся страна.

По словам главы государства, которые передаёт РБК, временные отключения и ограничения связи напрямую связаны с вопросами безопасности — прежде всего с угрозами ударов беспилотников.

«Ограничения интернета связаны с необходимостью обеспечения безопасности и сокращением до минимума опасности для здоровья — налётов и ударов дронов», — отметил Путин.

Президент обозначил два основных направления, по которым, по его словам, уже нужно работать. Первый — переход на отечественное программное обеспечение и российское «железо». Путин подчеркнул, что при использовании собственных технологий многие сервисы могут продолжать работать даже в условиях ограничений.

Второй вариант — взаимодействие с иностранными производителями, которые продолжают работать в России. Однако, как уточнил президент, в этом случае необходимо договариваться о переносе сервисов и инфраструктуры на территорию страны. По его словам, работа потребуется сразу по обоим направлениям.

Путин напомнил, что вопрос зависимости от зарубежного ПО обсуждается не первый год. Ещё в мае он говорил о необходимости значительно ускорить переход на отечественные решения, отметив, что нехватка собственного программного обеспечения была признана угрозой ещё в 2022 году.

Напомним, вчера в России расширили так называемый «белый список» сайтов и сервисов, которые продолжают работать даже в периоды ограничений мобильного интернета, вводимых по соображениям безопасности.

RSS: Новости на портале Anti-Malware.ru