Исследователи придумали способ находить подделки в PDF-документах

Исследователи придумали способ находить подделки в PDF-документах

Исследователи придумали способ находить подделки в PDF-документах

Учёные из Университета Претории (ЮАР) разработали новый способ выявления изменений в PDF-документах. Их прототип анализирует так называемые file page objects — это такие внутренние структуры файла, где хранится всё: от текста и картинок до метаданных.

PDF-формат давно стал стандартом в деловой переписке, поэтому неудивительно, что его часто используют мошенники — например, чтобы подделывать договоры или внедрять вредоносный код.

Сегодня редактировать PDF может кто угодно: есть и Adobe Acrobat, и куча онлайн-редакторов. Поэтому важно уметь быстро определять, менялся ли документ — и если да, то как именно.

Обычно для защиты PDF используют водяные знаки и хеши. Но эти подходы работают только с тем, что видно на глаз — текстом и изображениями. Если же злоумышленник подменил метаданные, добавил скрипт или изменил цифровую подпись, такие методы это не отловят.

К тому же, даже небольшое изменение меняет хеш-файл целиком — и непонятно, что именно было затронуто. А это неудобно, особенно в юридически важных документах.

Что придумали в Претории

Новый прототип работает на Python и использует библиотеки PDFRW, hashlib и Merkly. Вот как он устроен:

  1. Сначала PDF нужно “защитить”. Программа читает файл, находит все page objects и создаёт уникальные хеши для каждой страницы, разбивая её содержимое на кусочки по 256 байт. Эти хеши строятся по принципу дерева Меркла: есть “листья” (для каждого блока) и “корень” (общий хеш всей страницы).
  2. Также отдельно хешируется сам объект страницы и метаданные всего документа. Чтобы избежать ложных срабатываний, некоторые части пропускаются — они могут меняться от редактора к редактору и не несут смысла.
  3. Все хеши прячутся внутри документа — в специальные скрытые поля. После этого сохраняется новая версия PDF — уже “защищённая”.
  4. Если потом нужно проверить файл на изменения, программа достаёт из него все сохранённые хеши, заново рассчитывает новые — и сравнивает. Если что-то не совпадает, значит, документ менялся.

Главное достоинство — точность. Система может указать не только, что файл изменился, но и какую именно страницу и какой участок (в пределах 256 байт) тронули. Также покажет, если были переписаны метаданные.

 

Пока работает лучше всего с Adobe Acrobat

Прототип тестировали на файлах, изменённых в Adobe Acrobat, и в этих случаях он отрабатывал отлично. Теоретически, он должен справляться и с другими редакторами — потому что «защищённые» PDF создаются единообразно через PDFRW, — но это ещё предстоит проверить.

Важное ограничение: систему нельзя применить к «обычным» PDF-документам — сначала их нужно защитить через этот же инструмент. И пока он не умеет отслеживать, скажем, смену шрифта или вставку JavaScript.

Тем не менее даже в таком виде инструмент может стать отличной основой для будущих решений в области цифровой гигиены и защиты документов.

86% крупных компаний в России используют LLM, ИИ-агенты застряли в пилотах

86% крупных российских компаний уже используют или пилотируют большие языковые модели (LLM), однако до промышленной эксплуатации автономных ИИ-агентов дело пока дошло лишь у 8% организаций. К такому выводу пришли «Инфосистемы Джет» и Smart Ranking, изучившие уровень ИИ-зрелости российского крупного бизнеса. Исследование показывает: основным препятствием для масштабирования ИИ становятся не сами модели, а готовность корпоративных процессов, данных и инфраструктуры.

Исследование основано на опросе 52 крупных российских компаний, в которых в совокупности работает около 450 тыс. человек, семи глубинных интервью и кабинетном анализе. В опросе участвовали ИТ- и технические директора, а также руководители, отвечающие за цифровизацию и внедрение ИИ.

Большой языковой моделью сегодня пользуется или экспериментирует с ней большинство крупных российских компаний. 86% организаций уже внедряют LLM, причем 53% из них вывели решения на базе генеративного ИИ в промышленную эксплуатацию. Для значительной части бизнеса технология уже перешла из стадии экспериментов в рабочий инструмент.

При этом с ростом автономности решений их распространенность заметно снижается. Проекты с полуавтономными ИИ-агентами есть у 59% компаний, полностью автономные решения внедряют 25%, а мультиагентные системы — 23%. Однако в промышленной эксплуатации эти показатели значительно ниже: полуавтономные агенты работают в проде только у 15% компаний, автономные и мультиагентные системы — у 8% в каждой категории.

Интерес к агентным технологиям уже сформировался: более 60% компаний изучают возможности автономных и мультиагентных систем. Однако переход от экспериментов к массовому внедрению упирается в готовность корпоративной среды.

Почти половина компаний — 44% — отказывается от внедрения ИИ-агентов из-за недостаточной зрелости процессов, инфраструктуры данных и сложностей интеграции с корпоративными системами. Как отмечает глава Дирекции по разработке и внедрению ПО «Инфосистемы Джет» Максим Андрианов, ценность агентных решений напрямую зависит от качества данных, цифровизации процессов и наличия необходимых интеграций. 

Он добавил, что последние наблюдения показывают, что аппаратное обеспечение стало выполнять меньше вычислительной работы работы. Вследствие этого, производительность моделей ИИ выросла. Однако стоимость вычислительной инфраструктуры остается одним из главных ограничений: 58% респондентов назвали стоимость серверов барьером для внедрения ИИ.Еще 56% указали на юридические риски, 42% — на ограничения инвестиционных бюджетов, а 40% — на дефицит специалистов. В 17% компаний препятствием становится отсутствие ИИ-лидеров, способных отвечать за внедрение технологии.

Даже после запуска пилотов компании сталкиваются с проблемой экономической эффективности. Устойчивого финансового эффекта от ИИ не видят 46% участников исследования. Еще 40% не могут масштабировать проекты из-за отсутствия владельца продукта или процесса, а столько же респондентов отмечают нестабильное качество ИИ-систем, включая галлюцинации и другие сбои. 

Таким образом, крупный российский бизнес уже освоил генеративный ИИ, но внедряет агентные технологии значительно осторожнее. Почти половина компаний планирует увеличить инвестиции в ИИ, однако в ближайшие годы приоритетом, вероятно, останутся проекты с понятной экономикой и контролируемыми рисками.

Для перехода к следующему этапу компаниям потребуется не только доступ к более мощным моделям. Необходимы качественные данные, цифровизированные процессы, интеграция с корпоративными системами и механизмы контроля. Поэтому дальнейшее развитие корпоративного ИИ может сместить акцент с выбора самой модели на создание инфраструктуры, способной обеспечить измеримый бизнес-эффект.

RSS: Новости на портале Anti-Malware.ru