Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Российскому ИИ не хватает данных, а закон, по мнению бигтеха, держит их под замком. Ассоциация больших данных, в которую входят «Авито», «Сбер», «Ростелеком», «Яндекс», HH и VK, попросила Минцифры упростить использование обезличенной персональной информации для разработки и обучения нейросетей.

Сейчас любое алгоритмическое преобразование персональных данных считается обезличиванием.

Даже если технология практически исключает возможность установить личность человека, полученный массив всё равно остаётся персональными данными со всеми сопутствующими ограничениями. Защита вроде бы сработала, а юридический хвост никуда не делся.

АБД, по данным КоммерсантЪ, предлагает выделить технологии повышения приватности — Privacy Enhancing Technologies, или PETs — в отдельную категорию. Они позволяют обрабатывать, передавать и хранить информацию без раскрытия личности. Если риск идентификации равен нулю или составляет малые доли процента, такие данные предлагается использовать для ИИ без согласия граждан.

Обработка при этом должна проходить в России, российскими компаниями и только для разработки, обучения и применения ИИ. Кроме того, ассоциация предлагает ввести доверенных посредников — аккредитованные организации, которые будут хранить обезличенные массивы и предоставлять к ним доступ. Данные также хотят разделить на бесплатные, необходимые для исполнения закона, и платные — для коммерческих задач.

Участники рынка объясняют инициативу просто: российских датасетов мало, а большая их часть заперта внутри крупных экосистем. Собственные и партнёрские массивы уже не закрывают аппетиты современных моделей, особенно специализированных корпоративных решений.

Альтернативой остаются синтетические данные — искусственно созданные наборы без сведений о реальных людях. Но полностью заменить ими отраслевую статистику, поведенческие закономерности и другие ценные выборки получится не всегда.

Теперь мяч у Минцифры, которое на обращение пока не ответило. Бигтех тем временем даёт понять: без свежих данных российский ИИ далеко не уедет, сколько вычислительных мощностей ему ни подбрасывай.

Яндекс с нуля обучил полностью суверенную языковую модель

Яндекс представил Alice AI Foundation LLM — базовую версию новой языковой модели, полностью обученной с нуля. Компания самостоятельно собрала корпус, выбрала архитектуру и гиперпараметры, не используя готовые зарубежные модели.

Как сообщают «Ведомости», Alice AI Foundation содержит 80 млрд параметров и обучена на 18 трлн токенов. Благодаря архитектуре Mixture of Experts при обработке каждого токена активируются только 3 млрд параметров — весь 80-миллиардный коллектив одновременно будить не приходится. Контекстное окно достигает 262 144 токенов.

По внутренним тестам Яндекса, модель делит лидерство с Qwen3.5-35B-A3B-Base на задачах AIME 2026 и превосходит Nemotron-3-Super-120B-A12B-Base в ряде тестов на программирование, используя в четыре раза меньше активных параметров. В русскоязычных фактологических заданиях она также обошла более крупную DeepSeek-V4-Flash-Base с 284 млрд параметров. Впрочем, результаты получены на инфраструктуре самой компании и ещё нуждаются в независимой проверке.

Для оценки знаний, актуальных русскоязычной аудитории, Яндекс разработал бенчмарки WikiWebFacts и HardMultiQA. Первый проверяет знание дат, событий, определений и персоналий, второй — умение работать со сложными вопросами из медицины, права, ИТ и искусства. Наборы заданий, эталонные ответы и протоколы оценки опубликованы вместе с моделью.

Инженеры также переработали оптимизатор, совместив обмен данными между видеокартами с вычислениями и примерно вдвое ускорив шаги оптимизации. Каскад классификаторов сократил затраты на отбор обучающих документов в десятки раз, сохранив около 95% полезных материалов.

Веса, технические материалы и бенчмарки уже доступны на Hugging Face под Apache 2.0. Но это претрейн, а не готовый чат-бот: перед внедрением модель придётся дообучить и настроить. В будущем она станет полигоном для единой рассуждающей модели и ИИ-агентов «Алисы».

Яндекс называет разработку полностью суверенной, однако официальный порядок присвоения такого статуса в России заработает только в марте 2027 года.

RSS: Новости на портале Anti-Malware.ru