Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

В паблик выложена коллекция документов PDF общим объемом около 8 Тбайт, созданная сотрудниками NASA JPL (Jet Propulsion Laboratory). Ресурс можно использовать для поиска вредоносов, спрятанных в файлах, а также багов в реализациях PDF-технологии.

Работы по составлению репрезентативной выборки были проведены совместно с НКО PDF Association в рамках программы SafeDocs, запущенной DARPA. За неполных два года JPL удалось собрать 8 млн файлов и дополнить их метаданными.

Для начала команда изучила каталог публичного репозитория Common Crawl, чтобы выявить PDF, пригодные для включения в коллекцию. В июле и августе 2021 года таким образом было отобрано около 8 млн кандидатов, из которых 2 млн. оказались усеченной копией.

Дело в том, что на Common Crawl действуют ограничения на загрузку: вес файлов не должен превышать 1 Мбайт. Полноценные копии пришлось добывать самостоятельно, используя специальный софт и URL, зафиксированные в репозитории.

Различные метаданные, такие как программа, с помощью которой создавался PDF, извлекались и приобщались к коллекции. Для определения местоположения сервера с сайтом-источником использовалась общедоступная программа геолокации.

Итоговый объем получился впечатляющим — 8 Тбайт. Новая коллекция размещена на серверах AWS, образцы можно скачать в виде ZIP-файлов.

Спецификации PDF замысловаты и объемны (1000 страниц англоязычного текста, содержащего 70 ссылок на другие нормативные документы), и в реализациях нередко встречаются опасные огрехи. Так, открытый юзером PDF-файл с зашифрованными данными можно использовать для эксфильтрации, возможна и подмена содержимого, от которой не спасает даже цифровая подпись. Использование PDF-формата также позволяет надежно скрыть вредоносный код от антивирусных сканеров.

Подпишитесь на новости

Греф объяснил, почему российский ИИ отстаёт от Китая на полгода

Российские ИИ-модели отстают от китайских примерно на полгода, а Китай — на столько же от США. Такой технологический расклад представил глава Сбербанка Герман Греф на конференции «ГигаКонф 2026». Главной причиной отставания России он назвал ограниченный доступ к вычислительным мощностям.

Китайские разработчики, по его словам, таких проблем практически не испытывают и могут обучать модели без аналогичных инфраструктурных ограничений.

«Мы находимся в неравных условиях с китайскими компаниями, у которых фактически сегодня нет никаких ограничений в мощностях. По всем остальным параметрам, я считаю, мы ничем не уступаем», — заявил Греф.

Глава Сбербанка ожидает, что разрыв сохранится и в дальнейшем. Получается своеобразная очередь: российские модели догоняют китайские, китайские — американские, а владельцы дата-центров тем временем могут спокойно повышать цены на вычисления.

На этом фоне российский бизнес всё активнее использует зарубежные LLM. В 2026 году потребление таких моделей на крупнейших отечественных облачных платформах выросло в несколько раз, причём основной спрос сместился в сторону китайских Qwen и DeepSeek.

Оно и понятно: модели из КНР предлагают достойное качество, стоят дешевле западных аналогов и зачастую позволяют развернуть решение в собственном контуре.

RSS: Новости на портале Anti-Malware.ru