Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Открытая ИИ-модель научилась читать геномы от бактерий до человека

Команда Arc Institute вместе с инженерами NVIDIA представила Evo 2 — геномную ИИ-модель, которая умеет не только предсказывать следующий символ в ДНК, но и в целом довольно неплохо понимать генетический код во всех доменах жизни — от бактерий до человека.

Самое приятное для науки: проект выложили полностью открыто — с весами модели, кодом и датасетом.

Если первая Evo отлично чувствовала себя на бактериальных геномах (там гены часто стоят кучками по смыслу), то с эукариотами всё куда хаотичнее: интроны, сплайсинг, регуляторные участки, которые могут быть далеко от гена, и море слабых статистических сигналов. Evo 2 как раз и задумали как ответ на эту сложную логику больших геномов.

Технически это модель на архитектуре StripedHyena 2, которая умеет работать с очень длинным контекстом — до 1 млн нуклеотидов за раз. Обучали её на OpenGenome2: это почти 9 трлн пар оснований/«токенов» ДНК из всех доменов жизни (включая бактериофаги).

При этом датасет, по описанию авторов, специально «подрезали» по части вирусов, заражающих эукариот, чтобы снизить риски потенциального злоупотребления.

Интереснее всего даже не масштаб, а то, что модель «нащупала» сама. В аннотациях к работе описывают, что Evo 2 выучила признаки вроде границ экзонов / интронов (сплайс-сайтов), участков связывания транскрипционных факторов, даже некоторые структурные элементы белков — то есть куски биологии, которые человеку часто приходится ловить отдельными инструментами и с погрешностями.

А в прикладной части авторы показывают, что Evo 2 может оценивать влияние вариантов в геноме без дообучения под конкретную задачу — например, для вариантов гена BRCA1 в тестах заявляется точность выше 90% в классификации «похоже на доброкачественный» против «потенциально патогенный». Это ровно тот случай, когда модель может стать полезным фильтром: подсказать, на какие мутации тратить время в лаборатории в первую очередь.

Сторонние Android-приложения получат доступ к системе сканирования контента

Google разрабатывает общедоступный Android API, с помощью которого сторонние приложения смогут проверять изображения и другие файлы на устройстве и классифицировать их по уровню безопасности. В основе механизма лежит идея SafetyCore — системного компонента, который уже размывает интимные изображения в Google Messages.

ContentSafetyManager сможет принимать изображения, необработанные файлы и другие типы мультимедиа.

После анализа система присвоит контенту один из четырёх статусов: разрешён, требует предупреждения, заблокирован или не классифицирован. Приложение затем само решит, показать изображение, размыть его или спрятать.

Обработка должна выполняться локально (без отправки фотографий на серверы Google). При этом сам API не даёт приложению доступа ко всей галерее: соответствующие разрешения всё равно придётся получить отдельно.


Именно здесь начинается неприятная часть. Эксперты опасаются, что вредоносная программа с избыточными правами сможет прогонять через классификатор большие объёмы пользовательских файлов, составлять профили владельцев или использовать результаты анализа не по назначению. Google рекомендует разработчикам запрашивать только минимально необходимые разрешения.


Сам SafetyCore ранее вызвал скандал из-за автоматической установки без явного согласия пользователей и отсутствия обычного ярлыка. Компонент скачали более миллиарда раз, а некоторые владельцы Android устанавливают специальную заглушку, чтобы Play Store не мог вернуть его после удаления.


Google обещает локальную обработку и конфиденциальность. Пользователи задают логичный вопрос: если всё настолько безопасно, почему приложение сначала появилось на смартфоне, а объяснения — потом?

RSS: Новости на портале Anti-Malware.ru