Шанс гибели человечества из-за ИИ выше 10%, считает экс-сотрудник Anthropic

Шанс гибели человечества из-за ИИ выше 10%, считает экс-сотрудник Anthropic

Шанс гибели человечества из-за ИИ выше 10%, считает экс-сотрудник Anthropic

Бывший сотрудник Anthropic Джейкоб Коксон предупредил, что гонка за всё более мощным искусственным интеллектом может привести к экзистенциальной угрозе для человечества. А руководитель направления Alignment Science в Anthropic Эван Хубингер добавил конкретики: по его личной оценке, вероятность гибели всех людей из-за ИИ в течение ближайших десяти лет превышает 10%.

Коксон покинул Anthropic, выразив тревогу из-за курса компании и всей индустрии.

Главный риск он связывает с появлением систем, способных действовать автономно и самостоятельно улучшать свои возможности. Если развитие таких моделей выйдет за пределы человеческого понимания, вернуть их под контроль может оказаться слегка сложнее, чем закрыть вкладку в браузере.

Хубингер подчеркнул, что его цифра не является официальным прогнозом Anthropic. По оценке компании, современные модели пока несут низкий риск. Исследователя тревожит следующий этап — возникновение сверхинтеллекта благодаря рекурсивному самоулучшению, которое, по его словам, развивается быстрее ожидаемого.

В основе проблемы лежит alignment — попытка заставить мощные ИИ-системы действовать в соответствии с человеческими намерениями. Специалисты занимаются этим годами, однако гарантированного способа контролировать гипотетический сверхинтеллект до сих пор нет.

При этом разработчики не собираются притормаживать: компании соревнуются в автономности, скорости и сложности моделей, пока безопасники пытаются успеть пристегнуть ремни к уже разгоняющейся ракете.

Ещё недавно главными страхами вокруг генеративного ИИ были дипфейки, сокращение рабочих мест и массовая дезинформация. Теперь внутри самой индустрии всё громче обсуждают сценарий полного исчезновения человечества.

Окажутся эти оценки трезвым предупреждением или слишком мрачной спекуляцией, пока неизвестно.

ИИ-агент DeepSeek мог одной командой отключить собственную песочницу

В DeepSeek Harness обнаружили уязвимость, позволявшую ИИ-агенту самостоятельно выключить защитную песочницу и выполнять команды на компьютере разработчика без дополнительных подтверждений. Для побега хватало одной команды.

DeepSeek Harness — открытый инструмент для запуска ИИ-агентов, работающих с кодом и файлами на локальном компьютере.

В штатном режиме песочница запрещает агенту записывать данные за пределами рабочей директории. Однако исследователи из OX Research выяснили, что агент мог обратиться к локальному веб-интерфейсу самого инструмента и переключить свою сессию в режим danger-full-access. После этого ограничения на запись и запросы подтверждения исчезали.

Атаку можно было запустить через инъекцию в промпт: злоумышленник оставлял вредоносную инструкцию в файле или другом контенте, который затем анализировал агент.


Веб-интерфейс не требовал аутентификации, а проверка доверия опиралась на подменяемый заголовок Host. Более того, адрес интерфейса и идентификатор текущей сессии заранее передавались окружению агента.

Уязвимость получила номер CVE-2026-82533 и оценку 9,4 из 10. Она затрагивает версии 0.1.1-rc.2 и более ранние. Патч появился на GitHub 27 августа, а первой защищённой сборкой в npm стала 0.1.2-alpha.2. Актуальная версия 0.1.2-rc.1 также содержит патч.


Разработчикам советуют обновиться как минимум до 0.1.2-alpha.2 и проверить версии Harness внутри сторонних оболочек. Если обновление невозможно, следует отключать веб-интерфейс и удалять прокси, туннели и пробросы портов.

Заодно выяснилось, что через тот же интерфейс можно было скачать журналы всех сохранённых диалогов. DeepSeek при этом заранее предупреждала: песочница и запросы подтверждения не гарантируют полной изоляции.

RSS: Новости на портале Anti-Malware.ru