Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

Яндекс с нуля обучил полностью суверенную языковую модель

Яндекс разработал с нуля языковую модель Alice AI Foundation LLM и открыл её веса для самостоятельного запуска и дообучения. Компания называет разработку полностью суверенной и планирует сделать её основой будущей рассуждающей модели и ИИ-агентов «Алисы».

Как сообщают «Ведомости», Alice AI Foundation содержит 80 млрд параметров и обучена на 18 трлн токенов.

При обработке каждого токена активируются только 3 млрд параметров, модель использует архитектуру Mixture of Experts и подключает нужную часть экспертов, а не будит весь 80-миллиардный коллектив одновременно.

Такой подход должен снизить вычислительные затраты при запуске, не отказываясь от ёмкости крупной модели. Контекстное окно достигает 262 144 токенов.

При этом речь идёт о базовой модели после предобучения, а не о готовом чат-боте: чтобы получить разговорного ассистента или специализированный корпоративный инструмент, её ещё предстоит дообучить.

Веса опубликованы на Hugging Face под лицензией Apache 2.0. Разработчики могут запускать модель на собственной инфраструктуре, адаптировать её под свои задачи и использовать результат в исследовательских и коммерческих проектах.

Яндекс подчёркивает, что самостоятельно подготовил обучающий корпус, выбрал архитектуру и гиперпараметры, не опираясь на готовые иностранные модели.

Однако слово суверенная пока остаётся заявленной характеристикой: официальный порядок присвоения такого статуса в России должен заработать только с марта 2027 года.

RSS: Новости на портале Anti-Malware.ru