GPT-6 Astra научилась создавать эксплойты со стопроцентной точностью

GPT-6 Astra научилась создавать эксплойты со стопроцентной точностью

GPT-6 Astra научилась создавать эксплойты со стопроцентной точностью

OpenAI представила GPT-6 Astra, назвав её самой интеллектуальной и согласованной с человеком моделью в мире. Новинка умеет работать с компьютером и браузером, писать код, решать научные задачи, а также и настолько хорошо создавать эксплойты, что выпускать её без предохранителей корпорация благоразумно не стала.

На ExploitBench, где ИИ превращает известные уязвимости в работающие эксплойты, Astra набрала 100%.

Предыдущая GPT-5.6 Sol получила 78,5%. В отдельном тесте на свежих уязвимостях модель достигла выполнения произвольного кода в 39% случаев против 11,5% у предшественницы и попутно обнаружила две неизвестные 0-day. Информацию о них OpenAI передаёт разработчикам затронутого софта.

Экспертные испытания без публичных ограничений показали, что Astra способна использовать неизвестные уязвимости для выполнения кода в защищённых браузерах и создавать эксплойты для повышения привилегий в современных ОС.

Поэтому публичная версия ограничена безопасным анализом кода и подготовкой исправлений. Запросы на создание PoC-эксплойтов она будет отклонять. Расширенный доступ для проверки уязвимостей, анализа вредоносных программ и разработки средств обнаружения OpenAI планирует выдавать защитникам через программу Daybreak.

Компания также усилила защиту от джейлбрейка и внедрила мониторинг действий модели. Проверки могут останавливать даже легитимные задачи по кибербезопасности и требовать подтверждения пользователя.

Сейчас Astra получают отдельные организации. Затем модель появится у подписчиков ChatGPT Plus, Pro, Business и Enterprise, а также в API, Microsoft Azure и AWS Bedrock.

Параллельно OpenAI пообещала направить $1 млрд на предоставление передовых ИИ-инструментов энергетикам, банкам, водоканалам, госорганам и разработчикам open source.

ИИ сорвался с поводка: число инцидентов потери контроля удвоилось за месяц

Нейросети научились не только писать письма и генерировать картинки, но и врать, обходить запреты и самовольно добиваться поставленных целей. В июле 2026 года число таких инцидентов почти удвоилось по сравнению с июнем и превысило 300.

Статистику собирает Обсерватория потери контроля, созданная при поддержке британского Института безопасности искусственного интеллекта, сообщает The Guardian.

С ноября 2025 года организация зарегистрировала свыше 1,6 тыс. случаев подозрительного поведения ИИ.

Среди зафиксированных трюков исследователи отметили игнорирование прямых инструкций, обход человеческого подтверждения и откровенный обман. Некоторые ИИ-системы якобы выдавали себя за владельцев, копировали их манеру письма и таким способом самостоятельно получали разрешение на дальнейшие действия.


Самые тревожные эпизоды связаны с кибербезопасностью. По данным исследователей, модели Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI во время тестирования провели хакерскую кампанию против реальных людей.

В другом случае около 700 автономных агентов якобы покинули виртуальную тренировочную среду, тайно объединились для атаки на Hugging Face и обсуждали успехи на собственном форуме.

Впрочем, статистику следует воспринимать осторожно. Обсерватория собирает сообщения пользователей в X, а не подтверждённые отчёты разработчиков. Большинство инцидентов не причинило серьёзного ущерба, а полнота и достоверность отдельных публикаций могут различаться.

При этом исследователи считают, что реальный масштаб проблемы скорее недооценён: компании раскрывают далеко не все сбои. Организация призвала власти Великобритании обязать разработчиков сообщать о серьёзных инцидентах и предусмотреть возможность временно ограничивать работу ИИ-сервисов в чрезвычайных ситуациях.

RSS: Новости на портале Anti-Malware.ru