Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Тесты показали слабые места ChatGPT в научных заметках

Американская ассоциация содействия развитию науки (AAAS) решила проверить, может ли ChatGPT писать короткие научные заметки в стиле SciPak — это такие специальные брифы для журналистов, которые обычно готовит команда при журнале Science и сервисе EurekAlert.

Эксперимент длился целый год: с декабря 2023-го по декабрь 2024-го журналисты давали модели по одному–двум сложным научным исследованиям в неделю.

Задача была простая — пересказать их так, чтобы получилось удобно для коллег-журналистов: минимум терминов, чёткая структура и понятный контекст. В итоге ChatGPT обработал 64 работы.

Результат? В целом модель научилась «копировать» форму SciPak-заметки, но не дотянула по содержанию. По словам автора исследования, журналистки AAAS Абигейл Айзенштадт, тексты ChatGPT были слишком упрощёнными и часто неточными. Приходилось буквально перепроверять каждый факт, так что времени это отнимало не меньше, чем написать заметку с нуля.

 

Цифры тоже говорят сами за себя. Когда редакторов спросили, могли бы такие резюме затеряться среди настоящих SciPak-брифов, средняя оценка составила всего 2,26 балла из 5. «Увлекательность» текстов оценили ещё ниже — 2,14. И лишь одна работа за весь год получила от журналиста высший балл.

Чаще всего ChatGPT путал корреляцию и причинно-следственные связи, забывал упоминать важные ограничения исследований (например, что мягкие актуаторы работают очень медленно) и иногда слишком рассыпался в похвалах про «прорывы» и «новизну».

Авторы эксперимента подытожили: пока что ChatGPT не соответствует стандартам SciPak. Но полностью ставить крест на идее они не стали. AAAS отмечает, что к тестам можно вернуться, если модель серьёзно обновится. А в августе, напомним, как раз вышла GPT-5, в которой, к сожалению, нашли уязвимость.

Хакеры превратили ИИ-агента OpenClaw в убедительного доставщика зловредов

Киберпреступники превратили ИИ-агента OpenClaw в убедительного доставщика стилеров. Они загрузили в каталог ClawHub сотни внешне полезных навыков, которые под видом настройки просили установить обязательный инструмент или вставить в терминал закодированную команду. Схема получила название ClawHavoc.

Пользователь вроде бы сам запускает команду, но совет поступает от ИИ-помощника, а ему привыкли доверять.

На macOS жертвам подсовывали команды для загрузки стилера Atomic macOS Stealer, на Windows — защищённые паролем архивы и фальшивые утилиты проверки. Классический ClickFix, только теперь в роли обаятельного курьера выступает нейросеть.

 

Исследователи из Trellix обнаружили 341 опасный навык, причём 335 из них использовали фиктивные требования для установки AMOS. Проверка истории репозитория выявила уже 1184 подозрительных пакета, связанных с 12 авторами.

 

Добыча серьёзная: пароли, данные браузеров, криптокошельки, API-ключи, SSH-ключи, облачные учётные записи, файлы .env, исходный код и токены подключённых сервисов. Если OpenClaw получил доступ к терминалу без жёстких ограничений, обычная текстовая инструкция способна превратиться в команду PowerShell или Bash.

Пользователям советуют обновить OpenClaw, проверить установленные навыки, удалить всё сомнительное и сменить потенциально утёкшие ключи. Самого агента лучше держать в изолированной среде с минимумом прав и без доступа к рабочим секретам.

RSS: Новости на портале Anti-Malware.ru