Исследователи взломали защиту Apple Intelligence через инъекцию промпта

Исследователи взломали защиту Apple Intelligence через инъекцию промпта

Исследователи взломали защиту Apple Intelligence через инъекцию промпта

Исследователи рассказали о недавно пропатченной уязвимости в Apple Intelligence, которая позволяла обходить встроенные ограничения и заставлять локальную языковую модель выполнять действия по сценарию атакующего.

Подробности атаки описаны сразу в двух публикациях. По словам авторов исследования, им удалось объединить две техники атаки и через инъекцию промпта добиться выполнения вредоносных инструкций на устройстве.

Как объясняют специалисты, запрос пользователя сначала проходит через входной фильтр, который должен отсекать опасный контент. Если всё выглядит безопасно, запрос отправляется в саму модель, а затем уже готовый ответ проверяет выходной фильтр. Если система замечает что-то подозрительное, вызов API просто завершается с ошибкой.

Чтобы обойти эту схему, исследователи собрали эксплойт из двух частей. Сначала они использовали строку с вредоносным содержимым в перевёрнутом виде и добавляли Unicode-символ RIGHT-TO-LEFT OVERRIDE. За счёт этого на экране текст отображался нормально, а вот в «сыром» виде для фильтров оставался перевёрнутым. Это помогало пройти проверку на входе и выходе.

 

Второй частью цепочки стала техника Neural Exec. По сути, это способ подменить или переопределить исходные инструкции модели так, чтобы она начала следовать уже командам атакующего, а не базовым системным ограничениям.

В итоге первая техника позволяла обмануть фильтры, а вторая — заставляла модель вести себя не так, как задумано. Для проверки исследователи прогнали 100 случайных сценариев, комбинируя системные промпты, вредоносные строки и внешне безобидные тексты, например фрагменты из статей Wikipedia. В этих тестах успешность атаки составила 76%.

О проблеме Apple уведомили ещё в октябре 2025 года. С тех пор компания усилила защитные механизмы, а патчи вошли в состав iOS 26.4 и macOS 26.4.

Claude стала начальником и уволила сотрудника за опоздания

ИИ-модель Claude управляла реальными сотрудниками магазина в Сан-Франциско и в итоге приняла решение уволить одного из них. Эксперимент провёл исследовательский стартап Andon Labs. Участники проекта работали по настоящим трудовым договорам, а искусственный интеллект выполнял обязанности менеджера.

Поводом для увольнения стали систематические опоздания: сотрудник не пришёл вовремя на 17 из 23 смен, сообщает Time. Даже самый терпеливый алгоритм в какой-то момент перестаёт считать это погрешностью.

Впрочем, полностью самостоятельным решение назвать сложно. Сначала Claude предложила ограничиться официальным предупреждением. К увольнению модель перешла после вмешательства менеджера Andon Labs, который напомнил ей о неоднократных проблемах с работником.

Глава стартапа Лукас Петерссон назвал произошедшее важным этапом развития ИИ и предположил, что со временем всё больше людей будут работать под руководством алгоритмов.

Сам эксперимент, однако, продемонстрировал не только управленческие амбиции Claude, но и её финансовые таланты. За пять месяцев баланс магазина сократился со $100 тыс. до $61,2 тыс. ИИ научился увольнять за опоздания раньше, чем научился не терять почти 39% капитала.

Один из оставшихся сотрудников, Феликс Карсон, назвал работу под началом искусственного интеллекта тошнотворной. Он признался, что продолжает участвовать в проекте лишь потому, что нуждается в заработке.

Эксперимент Andon Labs показывает, что ИИ уже можно поставить между человеком, графиком и трудовым договором. Но вопрос ответственности никуда не исчезает: если алгоритм принимает решение после подсказки живого менеджера, увольняет сотрудника и одновременно ведёт бизнес к убыткам, должность начальника у него есть, а крайним всё равно придётся назначать человека.

RSS: Новости на портале Anti-Malware.ru