Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Новый вектор ProAttack позволяет незаметно внедрять бэкдоры в LLM

Промпт-инжиниринг давно стал нормой при работе с большими языковыми моделями. Но, как выясняется, вместе с удобством он приносит и новую поверхность атаки. Исследователи представили вектор под названием ProAttack, который позволяет внедрять бэкдор в модель через промпты, причём делать это почти незаметно.

В тестах атака показывала эффективность, близкую к 100%, причём без классических красных флагов вроде странных токенов или подмены меток.

В обычных атаках на NLP-модели злоумышленники добавляют в данные подозрительные слова или фразы и меняют метки. Такие вещи уже научились отслеживать. 

ProAttack идёт другим путём. Вместо явных «триггеров» он использует разные промпты для обучающих данных:

  • для части данных (целевая категория) — вредоносный промпт;
  • для остальных — обычный, чистый.

 

При этом сами тексты выглядят нормально, а метки остаются корректными. В итоге модель учится ассоциировать конкретный промпт с нужным злоумышленнику результатом.

А дальше всё просто: на этапе использования достаточно подать вход с этим промптом, и бэкдор срабатывает.

Особенно опасно, что атака остаётся эффективной даже при небольшом количестве данных. В ряде случаев хватало буквально нескольких (около шести) «отравленных» примеров, чтобы внедрить бэкдор.

Метод протестировали на разных задачах, включая даже медицинские сценарии (например, суммаризацию радиологических отчётов). И там он тоже показал высокую эффективность, практически не ухудшая качество работы модели.

Исследователи проверили ProAttack против популярных методов защиты — ONION, SCPD, back-translation и fine-pruning. Ни один из них не смог полностью остановить атаку.

В качестве возможного решения предлагается использовать LoRA (parameter-efficient fine-tuning). Идея в том, что такие методы ограничивают количество параметров, которые модель может менять при дообучении. А значит, ей сложнее запомнить связь между триггером и целевым результатом.

Подпишитесь на новости

Spectre вернулась: новая атака вытаскивает хеш пароля root из памяти Linux

Процессор помнит старый код, хотя на его месте уже работает новый. На этой нестыковке исследователи VUSec и Scuola Superiore Sant’Anna построили Branch Target Reuse — новый вариант Spectre v2. Атака затрагивает JIT-компиляторы, которые создают машинный код во время работы программы.

Подробности опубликованы в исследовании BTR. Когда участок памяти освобождают и используют повторно, предсказатель переходов CPU может сохранить устаревшую запись.

Процессор спекулятивно выполняет инструкции по старому адресу, а следы в кеше позволяют извлекать секретные данные.

Исследователи подтвердили проблемное поведение на протестированных процессорах Intel, AMD и Arm. Они изучили JIT-движки Firefox, GraalVM и Linux, но практические результаты различаются.


Самый убедительный пример — два эксплойта против ядра Linux. На системе Intel с действовавшими защитами исследователи продемонстрировали извлечение хеша пароля root за минуты. Именно хеша: готовый пароль и автоматический вход администратора атака не выдаёт.

Для Firefox подготовлен PoC, однако до полноценного браузерного эксплойта ещё требуется работа. В GraalVM практическую эксплуатацию в экспериментах затрудняла очистка состояния предсказателя.

Атакующему нужно выполнять непривилегированный код в подходящей JIT-среде. Одна лишь модель процессора ещё не означает, что конкретную систему можно успешно атаковать.

Защита уже появилась в ядре Linux и GraalVM. Mozilla делает ставку на завершение внедрения изоляции сайтов.

Spectre, похоже, уходить не собирается: ускоряя выполнение кода, процессоры продолжают оставлять исследователям новые поводы заглянуть туда, куда обычной программе нельзя.

RSS: Новости на портале Anti-Malware.ru