OpenAI будет передавать опасные чаты правоохранительным органам

OpenAI будет передавать опасные чаты правоохранительным органам

OpenAI будет передавать опасные чаты правоохранительным органам

Истории о том, как диалоги с чат-ботами заканчиваются психозами, госпитализацией или даже суицидом, уже больше года появляются в СМИ и соцсетях. На этом фоне OpenAI долгое время ограничивалась лишь общими обещаниями «улучшить защиту».

Теперь ситуация изменилась: в блоге OpenAI признала свои недоработки и сообщила, что начала сканировать пользовательские чаты на предмет опасного контента.

Если алгоритм «чует неладное», диалог попадает к небольшой команде сотрудников. А в случаях, когда модераторы видят «угрозу серьёзного физического вреда другим людям», компания может передать информацию в правоохранительные органы.

Интересный момент: о самоубийствах пока в полицию не сообщают — OpenAI объясняет это уважением к приватности и «уникально личному характеру общения с ChatGPT». Но компания открыто признаёт: да, мы читаем подозрительные чаты, а иногда делимся ими с властями.

Это, мягко говоря, выглядит противоречиво. С одной стороны, OpenAI отклоняет запросы издателей (включая New York Times), которые требуют доступ к логам переписок ради судебных разбирательств — и делает это под лозунгом защиты приватности пользователей. С другой — сама же может передавать чаты полиции.

Добавим к этому, что ещё недавно CEO Сэм Альтман честно говорил: разговор с ChatGPT как с психотерапевтом или юристом не равноценен конфиденциальной беседе с реальным специалистом. И если суды обяжут, то переписка пользователей вполне может оказаться в материалах дела.

В итоге получается странная картина: OpenAI вроде бы пытается закрыть дыры и снизить риски трагедий, но делает это так, что доверия к сервису у людей становится ещё меньше.

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

RSS: Новости на портале Anti-Malware.ru