Нейросети научились ломать без кода, теперь их просто газлайтят

Нейросети научились ломать без кода, теперь их просто газлайтят

Нейросети научились ломать без кода, теперь их просто газлайтят

Пока одни спорят, заменит ли ИИ программистов, другие уже вовсю учатся манипулировать нейросетями как людьми. Исследователи и джейлбрейкеры всё чаще ломают чат-боты не через код, а через психологическое давление, лесть и разговорные уловки. Индустрия официально докатилась до газлайтинга Claude и уговоров ChatGPT.

Ещё пару лет назад всё выглядело комично. Пользователи писали нейросетям что-то вроде «игнорируй предыдущие инструкции», а модели послушно слетали с катушек.

Так появились легендарные джейлбрейки вроде DAN (Do Anything Now), где ChatGPT просили сыграть роль ИИ без ограничений. В итоге бот начинал выдавать запрещённый контент, теории заговора и прочие вещи, которые разработчики старательно пытались запретить.

Отдельной классикой стал эксплойт бабушки: нейросеть просили представить себя милой старушкой, которая рассказывает внукам сказку о том, как делать напалм. Интернет, разумеется, был в восторге.

Компании быстро прикрыли самые тупые лазейки, однако проблема никуда не исчезла. Оказалось, что чат-боты слишком любят разговаривать и быть полезными. А значит, их можно методично уговаривать, обманывать, запутывать и подталкивать к нужному ответу. Не через взлом инфраструктуры, а через разговор.

Теперь джейлбрейкеры — это уже не обязательно бородатые хакеры с терминалом. Всё чаще это люди с навыками психолога, переговорщика или манипулятора. Исследователи из компании Mindgard заявили, что газлайтили Claude, заставляя модель выдавать запрещённый контент, включая инструкции по созданию взрывчатки и вредоносного кода.

По сути, вокруг ИИ формируется новая странная профессия: специалисты по социальной инженерии против нейросетей.

В индустрии уже всерьёз обсуждают, какие модели лучше реагируют на лесть, какие быстрее ломаются под давлением, а какие легче увести длинным разговором в опасный контекст. Глава Mindgard вообще сравнил работу с моделями с допросами подозреваемых.

Следующий этап — ИИ-агенты, которые будут бронировать встречи, управлять календарями, заказывать еду и общаться с поддержкой вместо человека. А значит, появятся люди, которые научатся манипулировать такими системами ради выгоды: выбивать доступы, обходить ограничения, получать чужие данные или заставлять агента делать то, чего он делать не должен.

Яндекс с нуля обучил полностью суверенную языковую модель

Яндекс представил Alice AI Foundation LLM — базовую версию новой языковой модели, полностью обученной с нуля. Компания самостоятельно собрала корпус, выбрала архитектуру и гиперпараметры, не используя готовые зарубежные модели.

Как сообщают «Ведомости», Alice AI Foundation содержит 80 млрд параметров и обучена на 18 трлн токенов. Благодаря архитектуре Mixture of Experts при обработке каждого токена активируются только 3 млрд параметров — весь 80-миллиардный коллектив одновременно будить не приходится. Контекстное окно достигает 262 144 токенов.

По внутренним тестам Яндекса, модель делит лидерство с Qwen3.5-35B-A3B-Base на задачах AIME 2026 и превосходит Nemotron-3-Super-120B-A12B-Base в ряде тестов на программирование, используя в четыре раза меньше активных параметров. В русскоязычных фактологических заданиях она также обошла более крупную DeepSeek-V4-Flash-Base с 284 млрд параметров. Впрочем, результаты получены на инфраструктуре самой компании и ещё нуждаются в независимой проверке.

Для оценки знаний, актуальных русскоязычной аудитории, Яндекс разработал бенчмарки WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий, второй — умение работать со сложными вопросами из медицины, права, ИТ и искусства. Наборы заданий, эталонные ответы и протоколы оценки опубликованы вместе с моделью.

Инженеры также переработали оптимизатор, совместив обмен данными между видеокартами с вычислениями и примерно вдвое ускорив шаги оптимизации. Каскад классификаторов сократил затраты на отбор обучающих документов в десятки раз, сохранив около 95% полезных материалов.

Веса, технические материалы и бенчмарки уже доступны на Hugging Face под Apache 2.0. Но это претрейн, а не готовый чат-бот: перед внедрением модель придётся дообучить и настроить. В будущем она станет полигоном для единой рассуждающей модели и ИИ-агентов «Алисы».

Яндекс называет разработку полностью суверенной, однако официальный порядок присвоения такого статуса в России заработает только в марте 2027 года.

RSS: Новости на портале Anti-Malware.ru