Атака HashJack: ИИ-браузер можно превратить во врага простым знаком

Атака HashJack: ИИ-браузер можно превратить во врага простым знаком

Атака HashJack: ИИ-браузер можно превратить во врага простым знаком

В Cato Networks разработали атаку на ИИ-браузеры, позволяющую манипулировать их выдачей при заходе юзера на легитимный сайт. Достаточно спрятать вредоносную команду в хештеге URL, и умный помощник превратится в орудие зла.

Новый метод непрямой инъекции в промпты, получивший название HashJack, полагается на доверие жертвы и к сайту, с которым она взаимодействует, и к браузерному ИИ-ассистенту.

Примечательно, что атаку в данном случае нельзя обнаружить серверными или сетевыми средствами: хештеги (якорь после знака # в адресе) обрабатываются на стороне клиента.

В рамках HashJack злоумышленник добавляет вредоносный фрагмент к легитимному URL и расшаривает итоговую ссылку через имейл, соцсеть или встраивает в веб-страницу.

Если при переходе по ней визитеру потребуется помощь ИИ, умный браузер включит в ответ результат выполнения скрытых инструкций — к примеру, подсунет рабочую фишинговую ссылку, даст вредный совет, а в агентском режиме может заработать, как бэкдор.

 

Тестирование с использованием различных сценариев проводилось на Copilot for Edge, Gemini for Chrome и Comet. Результаты оказались неутешительными:

 

* Edge выводит диалоговое окно, запрашивая согласие (“gating”) на гейтинг; Chrome зачатую переписывал URL как https://www.google.com/search?q=…, что смягчает, но не устраняет угрозу.

Получив соответствующее уведомление, Google заявила, что исправлять ничего не собирается, так как поведение ИИ-браузера не выходит за рамки допустимого и степень опасности невелика. В Microsoft и Perplexity сочли нужным выпустить фиксы.

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

RSS: Новости на портале Anti-Malware.ru