Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Американская ассоциация содействия развитию науки (AAAS) решила проверить, может ли ChatGPT писать короткие научные заметки в стиле SciPak — это такие специальные брифы для журналистов, которые обычно готовит команда при журнале Science и сервисе EurekAlert.

Эксперимент длился целый год: с декабря 2023-го по декабрь 2024-го журналисты давали модели по одному–двум сложным научным исследованиям в неделю.

Задача была простая — пересказать их так, чтобы получилось удобно для коллег-журналистов: минимум терминов, чёткая структура и понятный контекст. В итоге ChatGPT обработал 64 работы.

Результат? В целом модель научилась «копировать» форму SciPak-заметки, но не дотянула по содержанию. По словам автора исследования, журналистки AAAS Абигейл Айзенштадт, тексты ChatGPT были слишком упрощёнными и часто неточными. Приходилось буквально перепроверять каждый факт, так что времени это отнимало не меньше, чем написать заметку с нуля.

 

Цифры тоже говорят сами за себя. Когда редакторов спросили, могли бы такие резюме затеряться среди настоящих SciPak-брифов, средняя оценка составила всего 2,26 балла из 5. «Увлекательность» текстов оценили ещё ниже — 2,14. И лишь одна работа за весь год получила от журналиста высший балл.

Чаще всего ChatGPT путал корреляцию и причинно-следственные связи, забывал упоминать важные ограничения исследований (например, что мягкие актуаторы работают очень медленно) и иногда слишком рассыпался в похвалах про «прорывы» и «новизну».

Авторы эксперимента подытожили: пока что ChatGPT не соответствует стандартам SciPak. Но полностью ставить крест на идее они не стали. AAAS отмечает, что к тестам можно вернуться, если модель серьёзно обновится. А в августе, напомним, как раз вышла GPT-5, в которой, к сожалению, нашли уязвимость.

Подпишитесь на новости

Минцифры готовит единые правила включения сайтов в белый список

Попасть в «белый список» сайтов, доступных при ограничениях интернета, должно стать проще и понятнее. Минцифры начало готовить единые правила отбора ресурсов: бизнес жалуется на непрозрачность процедуры, а у ФСБ России появились претензии к тому, как формируются перечни.

Как сообщает РБК, именно эти жалобы стали поводом для разработки регламента. Пока правила готовят, утверждённого порядка ещё нет.

По данным издания, ФСБ недовольна тем, что операторы самостоятельно добавляют в списки своих партнёров. В результате доступ могут получать запрещённые ресурсы и VPN-сервисы. Получается, механизм исключений сам нуждается в наведении порядка.

Минцифры подтвердило работу над техническим совершенствованием системы. Среди ключевых задач — бесперебойная работа «Госуслуг» и банковских сервисов.

Сейчас «белый список» представляет собой административный перечень, который формируют по обращениям органов власти. Отдельного закона для него нет, а обязательным условием включения остаётся размещение серверов в России.

Для бизнеса проблема вполне денежная: пока заявку согласовывают, сервис может оставаться недоступным пользователям во время ограничений. По оценкам экспертов, ожидание способно растянуться на месяцы.

Единые критерии должны сделать отбор прозрачнее и дать компаниям равные условия. Но главный вопрос пока открыт: появится ли у бизнеса понятный маршрут с конкретными требованиями и сроками.

RSS: Новости на портале Anti-Malware.ru