Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Команда Arc Institute вместе с инженерами NVIDIA представила Evo 2 — геномную ИИ-модель, которая умеет не только предсказывать следующий символ в ДНК, но и в целом довольно неплохо понимать генетический код во всех доменах жизни — от бактерий до человека.

Самое приятное для науки: проект выложили полностью открыто — с весами модели, кодом и датасетом.

Если первая Evo отлично чувствовала себя на бактериальных геномах (там гены часто стоят кучками по смыслу), то с эукариотами всё куда хаотичнее: интроны, сплайсинг, регуляторные участки, которые могут быть далеко от гена, и море слабых статистических сигналов. Evo 2 как раз и задумали как ответ на эту сложную логику больших геномов.

Технически это модель на архитектуре StripedHyena 2, которая умеет работать с очень длинным контекстом — до 1 млн нуклеотидов за раз. Обучали её на OpenGenome2: это почти 9 трлн пар оснований/«токенов» ДНК из всех доменов жизни (включая бактериофаги).

При этом датасет, по описанию авторов, специально «подрезали» по части вирусов, заражающих эукариот, чтобы снизить риски потенциального злоупотребления.

Интереснее всего даже не масштаб, а то, что модель «нащупала» сама. В аннотациях к работе описывают, что Evo 2 выучила признаки вроде границ экзонов / интронов (сплайс-сайтов), участков связывания транскрипционных факторов, даже некоторые структурные элементы белков — то есть куски биологии, которые человеку часто приходится ловить отдельными инструментами и с погрешностями.

А в прикладной части авторы показывают, что Evo 2 может оценивать влияние вариантов в геноме без дообучения под конкретную задачу — например, для вариантов гена BRCA1 в тестах заявляется точность выше 90% в классификации «похоже на доброкачественный» против «потенциально патогенный». Это ровно тот случай, когда модель может стать полезным фильтром: подсказать, на какие мутации тратить время в лаборатории в первую очередь.

Taobao получила первый в России штраф за утечку среди иностранных компаний

Известные штрафы за утечки персональных данных в России достигли 2,195 млн рублей в первом полугодии 2026 года, подсчитала InfoWatch. Это втрое больше, чем за аналогичный период 2025-го, и примерно в полтора раза больше совокупной суммы за весь прошлый год.

За шесть месяцев российские суды вынесли 13 штрафов. Годом ранее за тот же период их было 15, однако денежные санкции оказались значительно скромнее — 725 тыс. рублей.

Аналитики ожидают дальнейшего роста сумм: новые штрафы действуют с мая 2025 года, а оборотные санкции за повторные утечки пока вообще не применялись.

Главным событием стало первое подобное наказание иностранной компании. Платформу Taobao, принадлежащую Alibaba Group, оштрафовали на 1 млн рублей после киберинцидента, при котором злоумышленники получили административные права на инфраструктуру и доступ к данным сотрудников и примерно 100 соискателей. Компания обжаловала решение.

В InfoWatch называют дело прецедентным: раньше иностранные сервисы наказывали главным образом за отказ локализовать данные россиян, теперь регулятор добрался и до самих утечек.

На мировом фоне российские суммы пока выглядят как мелочь из кармана. Крупнейший штраф первого полугодия получил корейский маркетплейс Coupang — около $409 млн за утечку данных примерно 33 млн пользователей. Но в целом можно отметить, что ценник за дырявую защиту уже пополз вверх.

RSS: Новости на портале Anti-Malware.ru