Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

Ученые НАСА собрали из Сети 8 млн PDF-файлов для изучения скрытых угроз

В паблик выложена коллекция документов PDF общим объемом около 8 Тбайт, созданная сотрудниками NASA JPL (Jet Propulsion Laboratory). Ресурс можно использовать для поиска вредоносов, спрятанных в файлах, а также багов в реализациях PDF-технологии.

Работы по составлению репрезентативной выборки были проведены совместно с НКО PDF Association в рамках программы SafeDocs, запущенной DARPA. За неполных два года JPL удалось собрать 8 млн файлов и дополнить их метаданными.

Для начала команда изучила каталог публичного репозитория Common Crawl, чтобы выявить PDF, пригодные для включения в коллекцию. В июле и августе 2021 года таким образом было отобрано около 8 млн кандидатов, из которых 2 млн. оказались усеченной копией.

Дело в том, что на Common Crawl действуют ограничения на загрузку: вес файлов не должен превышать 1 Мбайт. Полноценные копии пришлось добывать самостоятельно, используя специальный софт и URL, зафиксированные в репозитории.

Различные метаданные, такие как программа, с помощью которой создавался PDF, извлекались и приобщались к коллекции. Для определения местоположения сервера с сайтом-источником использовалась общедоступная программа геолокации.

Итоговый объем получился впечатляющим — 8 Тбайт. Новая коллекция размещена на серверах AWS, образцы можно скачать в виде ZIP-файлов.

Спецификации PDF замысловаты и объемны (1000 страниц англоязычного текста, содержащего 70 ссылок на другие нормативные документы), и в реализациях нередко встречаются опасные огрехи. Так, открытый юзером PDF-файл с зашифрованными данными можно использовать для эксфильтрации, возможна и подмена содержимого, от которой не спасает даже цифровая подпись. Использование PDF-формата также позволяет надежно скрыть вредоносный код от антивирусных сканеров.

Подпишитесь на новости

Swordfish Security добавила ИИ-агентов и RAG в оценку безопасности компаний

ИИ уже не просто отвечает на вопросы, корпоративные агенты получают доступ к инструментам и выполняют задачи без пошагового контроля человека. А значит, ошибка нейросети может превратиться в действие внутри рабочей системы. Swordfish Security обновила свой фреймворк оценки AI Security с учетом этих рисков.

Версия 2.0 методологии Swordfish: SAIMM представлена в центре экспертизы компании.

Документ предназначен для бесплатного использования специалистами по кибербезопасности и разработчиками. Он помогает оценить зрелость процессов защиты ИИ, выявить пробелы и определить очередность изменений.

Главное обновление — два дополнительных направления оценки: безопасность агентских систем и RAG-пайплайнов.

Первое касается поведения агентов, их действий и использования инструментов. Когда нейросети доверяют корпоративный процесс, одного контроля за текстом ответа уже мало: важно понимать, что она может сделать с выданными полномочиями.

Второе направление посвящено данным, которые ИИ использует для формирования ответов. RAG позволяет модели обращаться к внешним источникам — например, корпоративной базе знаний. Поэтому в оценку входят контроль данных, их связь с моделями, учет версий и происхождения компонентов.

По словам гендиректора Swordfish Security Александра Пинаева, обновленный фреймворк стал практичнее: компания может пройти по вопросам, зафиксировать текущий уровень зрелости и определить, какие следующие шаги дадут наибольший эффект.

Важная часть подхода — постоянный учет моделей и данных, фиксация инцидентов и наблюдение за нежелательным поведением. Генеративная система способна по-разному отвечать на один запрос, поэтому разовая проверка не закрывает вопрос безопасности.

RSS: Новости на портале Anti-Malware.ru