ИИ может склонировать JS-зловреда 10 тыс. раз и добиться FUD в 88% случаев

ИИ может склонировать JS-зловреда 10 тыс. раз и добиться FUD в 88% случаев

ИИ может склонировать JS-зловреда 10 тыс. раз и добиться FUD в 88% случаев

Проведенное в Palo Alto Networks исследование показало, что ИИ-модель можно заставить многократно обфусцировать вредоносный код JavaScript и в итоге получить семпл, не детектируемый антивирусами (FUD, fully undetectable).

Речь идет об онлайн-помощниках, авторы которых вводят ограничения во избежание злоупотреблений ИИ-технологиями — в отличие от создателей «злых» аналогов (WormGPT, FraudGPT и т. п.), заточенных под нужды киберкриминала.

Разработанный в Palo Alto алгоритм использует большую языковую модель (БЯМ, LLM) для пошаговой трансформации кода с сохранением его функциональности. При его тестировании на реальных образцах JavaScript-зловредов кастомный классификатор на основе модели глубокого обучения выдал вердикт «безвредный» в 88% случаев.

Опытным путем было установлено, что уровень детектирования снижается по мере увеличения количества итераций (в ходе экспериментов LLM создавала по 10 тыс. вариантов вредоноса). Примечательно, что привносимые изменения выглядели более естественно в сравнении с результатами готовых инструментов вроде obfuscator.io.

Для проведения исследования был также создан набор подсказок для выполнения различных преобразований, таких как переименование переменной, разделение строк, добавление мусора, удаление ненужных пробелов, альтернативная реализация функции.

Финальные варианты обфусцированных JavaScript были ради интереса загружены на VirusTotal. Их не смог распознать ни один антивирус; повторение проверок через четыре дня дало тот же эффект.

 

Результаты исследования помогли экспертам усовершенствовать свой инструмент детектирования JavaScript. Полученные с помощью LLM образцы были добавлены в тренировочный набор данных для модели машинного обучения; их использование позволило повысить результативность классификатора на 10%.

Зарубежные нейросети тайком учили на сотнях песен Басты, Билана и Лазарева

Российские артисты незаметно отправились обучать нейросети, сотни их песен нашли в открытых зарубежных датасетах. И нет, разрешения у правообладателей, похоже, никто не спрашивал. Аналитики Национальной федерации музыкальной индустрии изучили базы Laion-Disco-12M и Sleeping-D 9M через проект AI Watchdog журнала The Atlantic.

В них хранятся миллионы композиций с YouTube, а во втором наборе — ещё и тексты с Genius, пишут «Ведомости».

Главным преподавателем для ИИ оказался Баста: в датасетах нашли 193 и 104 его трека. Следом идут Feduk — 150 и 91 композиция, Сергей Лазарев — 144 и 118, Дима Билан — 140 и 119, а также группа «Звери» — 135 и 41. В списке засветились Леонид Агутин, Егор Крид, Ваня Дмитриенко и другие исполнители. Туда же попали десятки видеороликов с участием российских артистов.

Само наличие песни в базе ещё не доказывает, что конкретная нейросеть действительно на ней училась. Но вероятность такого сценария The Atlantic оценивает как высокую.

Представители музыкальной индустрии утверждают, что ни зарубежные, ни российские разработчики ИИ за лицензиями к ним не обращались. Рассуждения, видимо, были такие: если контент лежит в открытом интернете, значит, его будто бы можно молча забрать в учебник для алгоритма. Иногда источником могут становиться и пиратские площадки.

Тем временем легальные сделки на мировом рынке уже появляются: Warner Music договорилась с Suno, а Universal Music Group — с Udio. Но пока это редкие исключения.

По оценке НИУ ВШЭ, совокупные потери авторов и правообладателей из-за генеративного контента за 2025-2030 годы могут достигнуть 1 трлн рублей. Российская музыкальная индустрия теперь требует прозрачного лицензирования.

RSS: Новости на портале Anti-Malware.ru