Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

В паблик выложена коллекция документов PDF общим объемом около 8 Тбайт, созданная сотрудниками NASA JPL (Jet Propulsion Laboratory). Ресурс можно использовать для поиска вредоносов, спрятанных в файлах, а также багов в реализациях PDF-технологии.

Работы по составлению репрезентативной выборки были проведены совместно с НКО PDF Association в рамках программы SafeDocs, запущенной DARPA. За неполных два года JPL удалось собрать 8 млн файлов и дополнить их метаданными.

Для начала команда изучила каталог публичного репозитория Common Crawl, чтобы выявить PDF, пригодные для включения в коллекцию. В июле и августе 2021 года таким образом было отобрано около 8 млн кандидатов, из которых 2 млн. оказались усеченной копией.

Дело в том, что на Common Crawl действуют ограничения на загрузку: вес файлов не должен превышать 1 Мбайт. Полноценные копии пришлось добывать самостоятельно, используя специальный софт и URL, зафиксированные в репозитории.

Различные метаданные, такие как программа, с помощью которой создавался PDF, извлекались и приобщались к коллекции. Для определения местоположения сервера с сайтом-источником использовалась общедоступная программа геолокации.

Итоговый объем получился впечатляющим — 8 Тбайт. Новая коллекция размещена на серверах AWS, образцы можно скачать в виде ZIP-файлов.

Спецификации PDF замысловаты и объемны (1000 страниц англоязычного текста, содержащего 70 ссылок на другие нормативные документы), и в реализациях нередко встречаются опасные огрехи. Так, открытый юзером PDF-файл с зашифрованными данными можно использовать для эксфильтрации, возможна и подмена содержимого, от которой не спасает даже цифровая подпись. Использование PDF-формата также позволяет надежно скрыть вредоносный код от антивирусных сканеров.

Алиса всё-таки слышит звук до команды, Яндекс объяснил зачем

Яндекс выпустил большой технический ответ на разбор своих Android-приложений, автор которого заподозрил их в сборе аудио, контактов, данных банковских карт и другой конфиденциальной информации. В компании заявили: часть механизмов обнаружена верно, но выводы о тотальной слежке собраны не по адресу.

Главный вопрос — микрофон. По версии Яндекса, Алиса локально ждёт активационную фразу только при открытом приложении и не записывает разговоры непрерывно.

Однако в оперативной памяти действительно работает циклический аудиобуфер: примерно 1,5 секунды до активации и 0,5 секунды после неё. Часть звука перед командой может отправляться на сервер для проверки качества распознавания.

Компания признала, что возможность удалённо менять размер буфера способна насторожить пользователей, и пообещала жёстко ограничить его в одном из ближайших релизов.

Доступ к контактам Яндекс объяснил голосовыми командами вроде «Позвони маме». При первой синхронизации на сервер может передаваться вся адресная книга, затем — только изменения. Имена и номера не хешируются: компании нужны исходные значения для распознавания речи.

В Яндексе подчёркивают, что приложение не читает переписку в WhatsApp (принадлежит корпорации Meta, признанной экстремисткой и запрещённой в России), Telegram и Viber, а видит лишь способы связи, опубликованные мессенджерами в системной адресной книге Android.

Обвинения в небезопасной обработке банковских карт компания также отвергла. Их реквизиты, как утверждается, уходят напрямую в изолированный PCI DSS-контур, а не на обычные серверы приложения.

Проверку VPN-интерфейса объяснили сетевой диагностикой, резервный DNS — обходом сбоев провайдера, а список других приложений в манифесте — стандартным механизмом Android.

Напомним, на днях Яндекс также рассказал, что в корпорации создали отдельный язык для расчёта стоимости поездок.

RSS: Новости на портале Anti-Malware.ru