Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Американская ассоциация содействия развитию науки (AAAS) решила проверить, может ли ChatGPT писать короткие научные заметки в стиле SciPak — это такие специальные брифы для журналистов, которые обычно готовит команда при журнале Science и сервисе EurekAlert.

Эксперимент длился целый год: с декабря 2023-го по декабрь 2024-го журналисты давали модели по одному–двум сложным научным исследованиям в неделю.

Задача была простая — пересказать их так, чтобы получилось удобно для коллег-журналистов: минимум терминов, чёткая структура и понятный контекст. В итоге ChatGPT обработал 64 работы.

Результат? В целом модель научилась «копировать» форму SciPak-заметки, но не дотянула по содержанию. По словам автора исследования, журналистки AAAS Абигейл Айзенштадт, тексты ChatGPT были слишком упрощёнными и часто неточными. Приходилось буквально перепроверять каждый факт, так что времени это отнимало не меньше, чем написать заметку с нуля.

 

Цифры тоже говорят сами за себя. Когда редакторов спросили, могли бы такие резюме затеряться среди настоящих SciPak-брифов, средняя оценка составила всего 2,26 балла из 5. «Увлекательность» текстов оценили ещё ниже — 2,14. И лишь одна работа за весь год получила от журналиста высший балл.

Чаще всего ChatGPT путал корреляцию и причинно-следственные связи, забывал упоминать важные ограничения исследований (например, что мягкие актуаторы работают очень медленно) и иногда слишком рассыпался в похвалах про «прорывы» и «новизну».

Авторы эксперимента подытожили: пока что ChatGPT не соответствует стандартам SciPak. Но полностью ставить крест на идее они не стали. AAAS отмечает, что к тестам можно вернуться, если модель серьёзно обновится. А в августе, напомним, как раз вышла GPT-5, в которой, к сожалению, нашли уязвимость.

Подпишитесь на новости

Anthropic сообщила полиции об угрозах нападения в чате с Claude

Разговор с ИИ закончился визитом полиции. Во Флориде 30-летнюю Карли Мишель Хеллер обвинили в письменных угрозах насилия после переписки с Claude. По версии следствия, она заявила о намерении устроить стрельбу в офисе шерифа округа Ли, а затем сообщила, что приобрела оружие.

Как пишет Gulf Coast News, сообщения заметили системы безопасности Anthropic. Переписку передали на проверку человеку, после чего компания уведомила правоохранителей.

По сообщениям СМИ, сотрудники установили личность Хеллер и задержали её дома без лишнего шума. Шериф Кармайн Марсено рассказал, что женщина использовала Claude как дневник.

Хеллер предъявили обвинение в преступлении второй степени по закону Флориды. Виновность женщины предстоит установить суду.

История показывает границу, о которой легко забыть за дружелюбным интерфейсом: чат с ИИ нельзя воспринимать как дневник в запертом ящике. В этом случае потенциально опасные сообщения прошли автоматическую проверку, оценку специалиста и дошли до полиции.

При этом делать вывод, что любая резкая фраза автоматически приводит к аресту, оснований нет. Здесь, по версии следствия, переписка содержала конкретную цель предполагаемого нападения и заявление о приобретении оружия. Именно эти обстоятельства теперь будут разбирать в рамках дела.

RSS: Новости на портале Anti-Malware.ru