Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Американская ассоциация содействия развитию науки (AAAS) решила проверить, может ли ChatGPT писать короткие научные заметки в стиле SciPak — это такие специальные брифы для журналистов, которые обычно готовит команда при журнале Science и сервисе EurekAlert.

Эксперимент длился целый год: с декабря 2023-го по декабрь 2024-го журналисты давали модели по одному–двум сложным научным исследованиям в неделю.

Задача была простая — пересказать их так, чтобы получилось удобно для коллег-журналистов: минимум терминов, чёткая структура и понятный контекст. В итоге ChatGPT обработал 64 работы.

Результат? В целом модель научилась «копировать» форму SciPak-заметки, но не дотянула по содержанию. По словам автора исследования, журналистки AAAS Абигейл Айзенштадт, тексты ChatGPT были слишком упрощёнными и часто неточными. Приходилось буквально перепроверять каждый факт, так что времени это отнимало не меньше, чем написать заметку с нуля.

 

Цифры тоже говорят сами за себя. Когда редакторов спросили, могли бы такие резюме затеряться среди настоящих SciPak-брифов, средняя оценка составила всего 2,26 балла из 5. «Увлекательность» текстов оценили ещё ниже — 2,14. И лишь одна работа за весь год получила от журналиста высший балл.

Чаще всего ChatGPT путал корреляцию и причинно-следственные связи, забывал упоминать важные ограничения исследований (например, что мягкие актуаторы работают очень медленно) и иногда слишком рассыпался в похвалах про «прорывы» и «новизну».

Авторы эксперимента подытожили: пока что ChatGPT не соответствует стандартам SciPak. Но полностью ставить крест на идее они не стали. AAAS отмечает, что к тестам можно вернуться, если модель серьёзно обновится. А в августе, напомним, как раз вышла GPT-5, в которой, к сожалению, нашли уязвимость.

Подпишитесь на новости

Поток ИИ-слопа вынудил arXiv ввести лимит на новые статьи

Научный конвейер притормозили: с 1 октября arXiv разрешает каждому пользователю отправлять только две новые статьи за календарный месяц. Лимит общий для всех категорий, а отклонённая работа тоже расходует попытку. Написать текст за пару минут теперь недостаточно, придётся выбирать, что отправлять.

В блоге arXiv команда объясняет решение перегрузкой. В сентябре 2026 года репозиторий получил около 40 тысяч статей — вдвое больше, чем двумя годами ранее. Число обращений к сотрудникам и модераторам за месяц приблизилось к 9 тысячам.

Одной из причин называют генеративный ИИ. Он помогает раздувать небольшой результат до полноценной статьи или нарезать одно исследование на несколько публикаций (ту самую тактику салями). Новых выводов немного, зато повторяющегося текста хоть отбавляй.


Использование нейросетей не запрещено: о существенном применении нужно сообщать модераторам, а ответственность остаётся на авторах. Лимит касается всех отправителей, независимо от того, кто набирал текст.


Мера временная, она должна дать модераторам-добровольцам передышку, пока площадка обновляет правила и инструменты. При этом arXiv не проводит полноценное научное рецензирование.

RSS: Новости на портале Anti-Malware.ru