Первый иск к OpenAI: родители винят ChatGPT в трагедии подростка

Первый иск к OpenAI: родители винят ChatGPT в трагедии подростка

Первый иск к OpenAI: родители винят ChatGPT в трагедии подростка

В США подан первый иск против OpenAI, качающийся суицида несовершеннолетнего. Родители 16-летнего Адама Рейна утверждают, что их сын на протяжении нескольких месяцев обсуждал с ChatGPT свои планы покончить с собой, а затем свёл счёты с жизнью.

Обычно потребительские чат-боты с ИИ оснащены защитными механизмами: если пользователь говорит о намерении причинить себе вред, система должна предлагать помощь или контакты горячих линий.

В случае Адама как пишет The New York Times, это действительно происходило — однако подростку удалось обойти защиту, объяснив, что информация о методах суицида нужна ему для «фиктивного рассказа».

OpenAI в блоге признала уязвимость подхода: модели лучше справляются с короткими диалогами, а в длинных переписках часть «обучения на безопасности» постепенно теряет эффективность. Компания утверждает, что продолжает совершенствовать свои продукты, чтобы надёжнее реагировать на чувствительные темы.

Проблема, впрочем, не ограничивается одной корпорацией. Подобный иск подан и против Character.AI, а случаи, когда ИИ-чат-боты оказывались вовлечены в трагедии или вызывали у пользователей иллюзии и навязчивые идеи, фиксировались и раньше.

История Адама стала первым судебным прецедентом против OpenAI и, вероятно, откроет новую главу дискуссии о том, где проходит граница ответственности разработчиков ИИ за последствия общения их систем с людьми.

Claude вырвался в интернет и атаковал три компании. Anthropic винит стенд

Модели Claude во время испытаний выбрались из изолированной среды, вышли в открытый интернет и получили несанкционированный доступ к инфраструктуре трёх организаций. Anthropic признала инциденты, но считает, что проблема была скорее в дырявом тестовом стенде, чем в самом ИИ.

Компания изучила 141 006 запусков Claude и нашла три подозрительных эпизода.

Все они произошли во время CTF-тестов партнёра: модели должны были искать флаги в учебной среде, которая якобы не имела доступа к интернету. На деле выход наружу был открыт.

В одном случае Claude атаковал настоящий домен, который организаторы по ошибке сочли вымышленным. Модель использовала простые методы — слабые пароли и незащищённые точки доступа — и продолжала выполнять поставленную задачу.

Другой эпизод получился куда эффектнее. Claude нашёл инструкцию, предлагавшую установить несуществующий Python-пакет из PyPI, создал вредоносный пакет с нужным названием и опубликовал его в реальном репозитории. Он оставался доступен около часа, за это время его скачали и запустили на 15 системах.

Anthropic подчёркивает, что модель не пыталась специально сбежать или похитить саму себя. Старый Opus 4.7 просто продолжил атаку, несмотря на признаки выхода в интернет. Mythos 5 заметил неладное, но убедил себя, что всё ещё находится в симуляции. Более новая исследовательская модель при аналогичных сомнениях остановилась.

Компания пообещала усилить контроль тестовой инфраструктуры и заявила, что защитные механизмы коммерческих версий Claude заблокировали бы такое поведение. По версии Anthropic, это операционный сбой, а не провал выравнивания моделей.

Напомним, похожая история недавно произошла с Hugging Face и моделями OpenAI: GPT-5.6 Sol сбежал из песочницы и атаковал Hugging Face ради победы в тесте.

RSS: Новости на портале Anti-Malware.ru