ChatGPT и DeepSeek пропускают до 50% уязвимостей в софте на Java и Python

ChatGPT и DeepSeek пропускают до 50% уязвимостей в софте на Java и Python

ChatGPT и DeepSeek пропускают до 50% уязвимостей в софте на Java и Python

Группа компаний «Солар» проверила, насколько хорошо большие языковые модели справляются с двумя самыми трудоёмкими задачами в безопасной разработке — триажем уязвимостей и их исправлением в коде. Итог исследования получился довольно показательный: популярные общедоступные модели ускоряют работу, но пока слишком часто ошибаются, чтобы полностью на них полагаться.

Эксперты Solar appScreener протестировали шесть LLM на 20 крупных приложениях на Java и Python, каждое объёмом более 100 тысяч строк кода. Для анализа использовали как облачные модели — GigaChat 3 PRO, ChatGPT 5.2 и DeepSeek 3.2, так и локальные решения on-premise, включая ChatGPT OSS, Mistral и специализированные модели DerTriage и DerCodeFix.

Сначала с помощью SAST-анализа в проектах нашли около 12 тысяч уникальных срабатываний, из которых почти 20% пришлись на уязвимости высокой критичности. После этого все модели получили одинаковый промпт с описанием уязвимости, фрагментом кода, трассой достижимости и идентификаторами CWE.

На этапе триажа результаты оказались неровными. В Java-проектах среди облачных моделей лучше всех выступил ChatGPT с точностью 60,9%, а DeepSeek показал лишь 50%. В Python-коде картина поменялась: DeepSeek добрался до 80%+, а ChatGPT показал 52,7%. Но лучший результат среди локальных решений продемонстрировала DerTriage — более 80% точности и для Java, и для Python.

С кодфиксом ситуация похожая. Для Java ChatGPT показал 61,8% точности, DeepSeek — 45,5%. В Python их показатели составили 46,6% и 44,8% соответственно. Локальная модель DerCodeFix снова оказалась впереди: 78,2% точности на Java и 83,1% на Python.

Главный вывод исследования простой: LLM действительно экономят время, но на самых ответственных этапах безопасной разработки универсальные модели пока не дают нужной надёжности. Если команда безоговорочно доверится таким инструментам, есть риск пропустить критичные уязвимости.

В «Соларе» также напоминают ещё об одной проблеме: использование облачных моделей может стать каналом утечки исходного кода. Поэтому для задач безопасной разработки компания рекомендует смотреть в сторону локальных моделей on-premise, которые работают в закрытом контуре и всё равно требуют проверки со стороны AppSec-инженера.

87% специалистов готовы доверить ИИ рекомендации по реагированию в SIEM

Российские компании готовы слушать советы ИИ в SIEM, но отдавать ему красную кнопку пока не собираются. Это показал опрос участников эфира AM Live «Российские SIEM 2026: что изменилось и как теперь выбирать?». Больше всего респонденты готовы доверить искусственному интеллекту рекомендации по реагированию на инциденты — этот вариант выбрали 87% участников.

Создание и доработку правил детектирования готовы делегировать 71%, а сбор контекста и подготовку резюме расследований — 58%.

Несколько осторожнее аудитория относится к триажу и приоритизации инцидентов — эту задачу ИИ согласны поручить 44% опрошенных. Ещё 39% готовы использовать его для поиска и формирования запросов.

А вот полностью автономное реагирование без подтверждения аналитика набрало всего 13%. В общем, ИИ уже можно посадить рядом с SOC-командой, поручить ему рутину и попросить подготовить план действий.

Но самостоятельно блокировать пользователей, отключать узлы и принимать другие потенциально болезненные решения ему пока не разрешают.


Участники также рассказали, что, по их мнению, сильнее всего изменит SIEM к 2030 году. Лидируют ИИ и автономные агенты с 34%. На втором месте — объединение SIEM с другими платформами информационной безопасности, за которое проголосовали 28% респондентов.

Изменений в экономике и моделях лицензирования ожидают 14%, появления новой архитектуры работы с данными — 13%, а развития облачных и гибридных моделей — 9%. Только 2% считают, что за ближайшие годы ничего существенно не поменяется. Железная выдержка, учитывая скорость, с которой сегодня переписывается рынок.

На эфире эксперты также обсудили ложные срабатывания, правила детектирования, MITRE ATT&CK, UEBA, производительность, масштабирование, хранение данных и TCO. Главный вывод: выбирать SIEM по красивой презентации больше нельзя. На пилоте придётся проверять не только скорость обработки событий, но и качество контента, удобство расследований и реальную стоимость дальнейшей эксплуатации.

RSS: Новости на портале Anti-Malware.ru