Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Промпт-инжиниринг давно стал нормой при работе с большими языковыми моделями. Но, как выясняется, вместе с удобством он приносит и новую поверхность атаки. Исследователи представили вектор под названием ProAttack, который позволяет внедрять бэкдор в модель через промпты, причём делать это почти незаметно.

В тестах атака показывала эффективность, близкую к 100%, причём без классических красных флагов вроде странных токенов или подмены меток.

В обычных атаках на NLP-модели злоумышленники добавляют в данные подозрительные слова или фразы и меняют метки. Такие вещи уже научились отслеживать. 

ProAttack идёт другим путём. Вместо явных «триггеров» он использует разные промпты для обучающих данных:

  • для части данных (целевая категория) — вредоносный промпт;
  • для остальных — обычный, чистый.

 

При этом сами тексты выглядят нормально, а метки остаются корректными. В итоге модель учится ассоциировать конкретный промпт с нужным злоумышленнику результатом.

А дальше всё просто: на этапе использования достаточно подать вход с этим промптом, и бэкдор срабатывает.

Особенно опасно, что атака остаётся эффективной даже при небольшом количестве данных. В ряде случаев хватало буквально нескольких (около шести) «отравленных» примеров, чтобы внедрить бэкдор.

Метод протестировали на разных задачах, включая даже медицинские сценарии (например, суммаризацию радиологических отчётов). И там он тоже показал высокую эффективность, практически не ухудшая качество работы модели.

Исследователи проверили ProAttack против популярных методов защиты — ONION, SCPD, back-translation и fine-pruning. Ни один из них не смог полностью остановить атаку.

В качестве возможного решения предлагается использовать LoRA (parameter-efficient fine-tuning). Идея в том, что такие методы ограничивают количество параметров, которые модель может менять при дообучении. А значит, ей сложнее запомнить связь между триггером и целевым результатом.

CryptoFlash ускорили и пересертифицировали: ФСБ дала добро до 2029 года

Компания «Аладдин» получила новый сертификат ФСБ России на защищённый флеш-накопитель Aladdin CryptoFlash. Документ № СФ/124-5574 действует до 16 июля 2029 года и подтверждает соответствие устройства требованиям к средствам криптографической защиты информации классов КС1 и КС2.

Вместе с сертификатом накопитель обзавёлся несколькими обновлениями. В список поддерживаемых Linux-систем вошли РЕД ОС 7.3 и 8, «Альт 8 СП Рабочая станция», «Альт Рабочая станция» 10 и ОС «Московской электронной школы».

Графический интерфейс доработали, а скорость чтения и записи увеличили до 11 МБ/с. Не гоночный болид, конечно, зато данные шифруются прямо на борту.

Aladdin CryptoFlash представляет собой USB-накопитель со встроенным аппаратным шифрованием по российскому алгоритму «Магма». Он предназначен для хранения и переноса информации, не содержащей гостайну, включая служебные и конфиденциальные данные с пометкой ДСП.

Устройство относится к классу Clientless: устанавливать дополнительное программное обеспечение на компьютер не требуется. Подключил накопитель — и можно работать без плясок с драйверами и отдельными криптографическими приложениями.

При этом прежний сертификат ФСБ № СФ/124-5342 от 15 декабря 2025 года никто не отменял: он продолжает действовать до 15 декабря 2028-го. Теперь у CryptoFlash сразу два действующих документа — старый остаётся в силе, а новый распространяется на обновлённую версию устройства.

RSS: Новости на портале Anti-Malware.ru