Исследователи показали, как управлять «мыслями» ИИ на лету

Исследователи показали, как управлять «мыслями» ИИ на лету

Исследователи показали, как управлять «мыслями» ИИ на лету

Команда из T-Bank AI Research предложила новый подход к интерпретации и управлению большими языковыми моделями — вроде тех, что лежат в основе современных чат-ботов. Разработку представили на международной конференции ICML в Ванкувере, одном из крупнейших событий в области машинного обучения.

Речь идёт о модифицированном методе SAE Match, который позволяет не просто наблюдать за тем, как модель обрабатывает информацию, но и влиять на это поведение без переобучения или вмешательства в архитектуру.

Что нового?

Вместо того чтобы просто смотреть, какие признаки активируются в слоях модели, исследователи научились строить граф потока признаков. Он показывает, как определённые смысловые элементы (например, тема или стиль ответа) зарождаются и проходят через внутренние механизмы модели — от attention до feedforward.

Самое интересное — теперь можно точечно усиливать или подавлять эти элементы. Например, изменить тональность текста или убрать нежелательную тему. Причём это делается не путём настройки модели заново, а с помощью управления внутренними активностями на нужных этапах.

Почему это важно?

  • Можно контролировать поведение модели более точно, если воздействовать сразу на несколько уровней обработки.
  • Не нужны дополнительные данные или переобучение, метод работает с уже обученными моделями.
  • Прозрачность — можно проследить, откуда берётся тот или иной фрагмент текста: из контекста или из внутренних «знаний» модели.
  • Безопасность — если модель сгенерировала что-то нежелательное, теперь можно понять, почему так вышло, и в будущем избежать повторения.

В чём уникальность?

Раньше интерпретация ИИ сводилась к тому, чтобы просто наблюдать, как он работает. Теперь же появляется возможность вмешиваться в процесс генерации — причём быстро и точечно. Это может быть полезно не только в научных задачах, но и в реальных продуктах, где важно избегать неожиданных или опасных ответов от ИИ.

Так что теперь исследователи могут не просто догадываться, что происходит внутри модели, а действительно видеть и управлять этими процессами. И это, по сути, шаг к более контролируемому и предсказуемому искусственному интеллекту.

Новый Android-троян ворует ПИН-коды и СМС через фальшивый Play Protect

Исследователи из Zimperium обнаружили новый банковский троян для Android под названием Rokarolla. Судя по возможностям зловреда, его создатели решили не мелочиться: вредоносная программа поддерживает 137 удалённых команд и способна практически полностью захватить контроль над смартфоном жертвы.

Основная цель Rokarolla — банковские приложения и криптокошельки. В списке целей исследователи насчитали 217 финансовых и криптовалютных сервисов.

Распространяется троян через поддельные сайты, которые маскируются под популярные приложения вроде TikTok или Google Chrome. Пользователю предлагают скачать программу, после чего на устройство попадает дроппер, выдающий себя за Google Play Protect.

Получив необходимые разрешения через службу специальных возможностей Android, троян начинает работать. Одной из первых его команд становится отключение настоящего Google Play Protect.

 

Для кражи данных Rokarolla использует классическую схему с оверлеями. Когда пользователь открывает банковское приложение, поверх него появляется фальшивая страница входа, визуально неотличимая от настоящей. Всё, что вводит жертва — логины, пароли, номера карт и другие данные — сразу отправляется злоумышленникам.

Кроме того, троян умеет подменять экран блокировки Android. Таким образом он может похищать ПИН-коды, графические ключи и пароли для разблокировки устройства.

В арсенале Rokarolla также есть кейлоггер, перехватчик уведомлений, доступ к контактам и полный контроль над СМС. Зловред способен читать сообщения, отправлять их самостоятельно и даже блокировать входящие звонки. Это позволяет перехватывать одноразовые банковские коды и мешать службе безопасности банка связаться с владельцем устройства.

Не забыли злоумышленники и про криптовалюту. Троян незаметно меняет содержимое буфера обмена, подставляя адреса кошельков атакующих вместо тех, которые пользователь скопировал сам.

По данным Zimperium, Rokarolla использует несколько резервных серверов управления и может быстро переключаться между ними. Поэтому простая блокировка одного домена проблему не решает.

RSS: Новости на портале Anti-Malware.ru