Мошенников, освоивших ИИ, выдают артефакты на фейковых сайтах

Мошенников, освоивших ИИ, выдают артефакты на фейковых сайтах

Мошенников, освоивших ИИ, выдают артефакты на фейковых сайтах

Проведенное в «Лаборатории Касперского» исследование показало, что поддельные сайты, созданные с помощью ИИ, могут содержать следы использования таких онлайн-сервисов, которые мошенники поленились или забыли вычистить.

Рост доступности больших языковых моделей (БЯМ, LLM) способствует, в числе прочего, увеличению количества злоупотреблений.

Использование инструментов на их основе позволяет поставить генерацию контента, в том числе вредоносного, на поток, однако ИИ-помощников нельзя оставлять без присмотра, о чем не знают или забывают обманщики.

В ходе анализа на фишинговых и скамерских сайтах эксперты обнаружили такие артефакты, как ответы чат-ботов, в которых сработала встроенная защита; лексикон, характерный для известных LLM; служебные пометки со ссылкой на ИИ-сервис.

Так, из-за больших масштабов автоматизации или кривых рук на созданных ИИ страницах зачастую можно встретить извинения чат-бота, которому этикет не позволяет выполнить запрос. Взамен он предлагает «сделать что-то похожее», и это тоже попадает в паблик.

 

В данном примере присутствуют и другие свидетельства фейка — диакритический знак в слове «Login» и буква «ɱ» вместо «m» в заголовке (замена по методу тайпсквоттинга).

Использование LLM, по словам экспертов, могут также выдать характерные слова и фразы. Чат-боты OpenAI, например, часто употребляют delve («штудировать»), а конструкции вроде in the ever-evolving / ever-changing world / landscape («в изменчивом /развивающемся мире / ландшафте») использует множество нейросетей.

Предательский отказ ассистента подчиниться и другие маркеры изредка встречаются также в мегатегах поддельных сайтов. В примере ниже исследователи обнаружили еще один признак мошенничества — имя «bolygon» в URL имитации легитимного Polygon.

 

«Злоумышленники активно изучают возможности применения больших языковых моделей в разных сценариях автоматизации, но, как видно, иногда допускают ошибки, которые их выдают, — отметил руководитель группы исследований и ML-разработок в Kaspersky Владислав Тушканов. — Однако подход, основанный на определении поддельной страницы по наличию тех или иных “говорящих слов”, ненадёжен. Поэтому пользователям нужно обращать внимание на подозрительные признаки, например логические ошибки и опечатки на странице. Важно убедиться, что адрес сайта совпадает с официальным».

Cloud.ru открыл код фильтра, который не отдаст пароли и ПДн нейросети

Cloud.ru открыл исходный код Guardrails Filter — инструмента, который не даёт пользователям случайно скормить языковой модели персональные данные, пароли, API-ключи и другие корпоративные секреты. Компании смогут бесплатно развернуть сервис в собственной инфраструктуре и подключить его к моделям любых провайдеров.

Guardrails Filter встаёт между корпоративным приложением и нейросетью. Перед отправкой запроса он ищет конфиденциальную информацию и заменяет её синтетическими значениями.

Когда модель формирует ответ, сервис возвращает исходные данные на место. В итоге пользователь получает нормальный результат, а условный «пароль_от_прода» не отправляется неизвестно куда вместе с просьбой составить отчёт.

Инструмент уже применяется в среде AI Factory для защиты запросов к сервису Foundation Models, а также в клиентских и внутренних проектах Cloud.ru. Открытая версия не привязана к облачной платформе компании и может работать внутри закрытого ИТ-контура.

Пользователям доступны готовые правила обнаружения конфиденциальной информации. Можно создавать и собственные — например, для номеров договоров, идентификаторов клиентов или кодовых названий проектов. Управление осуществляется через личный кабинет: там разрешается настраивать и тестировать правила, просматривать журналы и отслеживать предупреждения.

В Guardrails Filter также есть Ghost Mode. Он позволяет проверить, какие данные сервис стал бы блокировать, но пока не вмешиваться в реальный трафик. Удобный режим для тех, кто не хочет включать защиту рубильником и затем выяснять, почему половина запросов внезапно исчезла.

На публичном бенчмарке pii-bench инструмент получил 93,1 балла по метрике F1. Заявленная точность срабатываний достигла 99,9% — примерно 999 из 1000 обнаружений должны быть верными.

Исходный код версий Standalone и ExtProc опубликован на GitHub и GitVerse. Теперь защищать корпоративные данные от слишком любознательных нейросетей можно собственными силами и заодно проверить, что именно происходит под капотом.

RSS: Новости на портале Anti-Malware.ru