Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Команда Arc Institute вместе с инженерами NVIDIA представила Evo 2 — геномную ИИ-модель, которая умеет не только предсказывать следующий символ в ДНК, но и в целом довольно неплохо понимать генетический код во всех доменах жизни — от бактерий до человека.

Самое приятное для науки: проект выложили полностью открыто — с весами модели, кодом и датасетом.

Если первая Evo отлично чувствовала себя на бактериальных геномах (там гены часто стоят кучками по смыслу), то с эукариотами всё куда хаотичнее: интроны, сплайсинг, регуляторные участки, которые могут быть далеко от гена, и море слабых статистических сигналов. Evo 2 как раз и задумали как ответ на эту сложную логику больших геномов.

Технически это модель на архитектуре StripedHyena 2, которая умеет работать с очень длинным контекстом — до 1 млн нуклеотидов за раз. Обучали её на OpenGenome2: это почти 9 трлн пар оснований/«токенов» ДНК из всех доменов жизни (включая бактериофаги).

При этом датасет, по описанию авторов, специально «подрезали» по части вирусов, заражающих эукариот, чтобы снизить риски потенциального злоупотребления.

Интереснее всего даже не масштаб, а то, что модель «нащупала» сама. В аннотациях к работе описывают, что Evo 2 выучила признаки вроде границ экзонов / интронов (сплайс-сайтов), участков связывания транскрипционных факторов, даже некоторые структурные элементы белков — то есть куски биологии, которые человеку часто приходится ловить отдельными инструментами и с погрешностями.

А в прикладной части авторы показывают, что Evo 2 может оценивать влияние вариантов в геноме без дообучения под конкретную задачу — например, для вариантов гена BRCA1 в тестах заявляется точность выше 90% в классификации «похоже на доброкачественный» против «потенциально патогенный». Это ровно тот случай, когда модель может стать полезным фильтром: подсказать, на какие мутации тратить время в лаборатории в первую очередь.

UDV NTA 2.0 подключила генеративный ИИ к анализу сетевых атак

UDV Group выпустила UDV NTA 2.0 — новую версию системы анализа сетевого трафика с ИИ-ассистентом. Он должен помочь аналитикам SOC быстрее понимать, что именно происходит в сети и насколько обнаруженная активность опасна для конкретной компании.

Обычная NTA видит подозрительные соединения, отклонения и признаки атак, но не всегда понимает, что перед ней: вторжение или очередной хитрый бизнес-процесс, о котором забыли предупредить безопасников.

Новый ассистент учитывает внутренние регламенты, критичность активов, особенности инфраструктуры и работы организации, после чего помогает расставить приоритеты и предлагает варианты реагирования.

UDV Group называет разработку первым российским NTA-решением с генеративным ИИ. По замыслу компании, ассистент должен сократить поток нерелевантных срабатываний и избавить специалистов от части ручной рутины.

Одним ИИ обновление не ограничилось. UDV NTA 2.0 научилась проверять IP-адреса, домены, URL и хеши по встроенным или пользовательским репутационным спискам.

Сигнатурный анализ теперь учитывает положение узла относительно периметра, а переработанная логика обнаружения DNS-туннелей должна выдавать меньше ложных тревог.

Разработчики также ускорили проактивный поиск угроз. На нагруженных инсталляциях список сетевых сессий загружается в десятки раз быстрее, подсчёт по фильтрам ускорился на 20%, а потребление оперативной памяти сократилось вдвое.

Кроме того, система получила поиск по частичному совпадению доменов и поддержку новых корпоративных и промышленных протоколов, включая Modbus RTU over TCP, Regul, SSDP, mDNS, LLMNR, RTSP, PTP и протоколы Zabbix.

RSS: Новости на портале Anti-Malware.ru