Исследователи показали, как управлять «мыслями» ИИ на лету

Исследователи показали, как управлять «мыслями» ИИ на лету

Исследователи показали, как управлять «мыслями» ИИ на лету

Команда из T-Bank AI Research предложила новый подход к интерпретации и управлению большими языковыми моделями — вроде тех, что лежат в основе современных чат-ботов. Разработку представили на международной конференции ICML в Ванкувере, одном из крупнейших событий в области машинного обучения.

Речь идёт о модифицированном методе SAE Match, который позволяет не просто наблюдать за тем, как модель обрабатывает информацию, но и влиять на это поведение без переобучения или вмешательства в архитектуру.

Что нового?

Вместо того чтобы просто смотреть, какие признаки активируются в слоях модели, исследователи научились строить граф потока признаков. Он показывает, как определённые смысловые элементы (например, тема или стиль ответа) зарождаются и проходят через внутренние механизмы модели — от attention до feedforward.

Самое интересное — теперь можно точечно усиливать или подавлять эти элементы. Например, изменить тональность текста или убрать нежелательную тему. Причём это делается не путём настройки модели заново, а с помощью управления внутренними активностями на нужных этапах.

Почему это важно?

  • Можно контролировать поведение модели более точно, если воздействовать сразу на несколько уровней обработки.
  • Не нужны дополнительные данные или переобучение, метод работает с уже обученными моделями.
  • Прозрачность — можно проследить, откуда берётся тот или иной фрагмент текста: из контекста или из внутренних «знаний» модели.
  • Безопасность — если модель сгенерировала что-то нежелательное, теперь можно понять, почему так вышло, и в будущем избежать повторения.

В чём уникальность?

Раньше интерпретация ИИ сводилась к тому, чтобы просто наблюдать, как он работает. Теперь же появляется возможность вмешиваться в процесс генерации — причём быстро и точечно. Это может быть полезно не только в научных задачах, но и в реальных продуктах, где важно избегать неожиданных или опасных ответов от ИИ.

Так что теперь исследователи могут не просто догадываться, что происходит внутри модели, а действительно видеть и управлять этими процессами. И это, по сути, шаг к более контролируемому и предсказуемому искусственному интеллекту.

Российские физики научили жидкий свет запоминать данные

Учёные из Российского квантового центра, МФТИ и СПбГУ показали, что поляритонный конденсат способен сохранять поляризацию светового сигнала на протяжении сотен пикосекунд — в сотни раз дольше жизни отдельной квазичастицы. В перспективе эффект можно использовать для создания оптической памяти, которой не придётся постоянно переводить фотоны в электрические сигналы и обратно.

Поляритоны возникают при сильном взаимодействии света с электронными возбуждениями в полупроводнике.

В большом количестве они образуют коллективное состояние, которое за необычные свойства называют жидким светом. Отдельный поляритон исчезает почти мгновенно, однако оставленная входным импульсом поляризация продолжает жить во всём конденсате.

Система не клонирует фотон и не сохраняет его целиком, зато запоминает состояние поляризации даже очень слабого сигнала.

Несколько сотен пикосекунд звучат не особенно впечатляюще рядом с флешкой, которая хранит отпускные фотографии годами. Но внутри оптического процессора это солидный запас времени: свет успевает пройти между вычислительными узлами, не превращаясь по дороге в электричество.

Такой подход способен упростить архитектуру фотонных и квантовых вычислителей, ускорить обмен данными и снизить энергопотребление. Особенно важно, что поляритонные системы можно создавать в материалах, работающих при комнатной температуре, а не только в лабораторном морозильнике.

Результаты опубликованы в журнале Physical Review Letters. Российский квантовый центр рассматривает поляритонный конденсат как возможную основу для классической и однофотонной памяти.

RSS: Новости на портале Anti-Malware.ru