Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Бигтех в России просит открыть обезличенные данные граждан для обучения ИИ

Российскому ИИ не хватает данных, а закон, по мнению бигтеха, держит их под замком. Ассоциация больших данных, в которую входят «Авито», «Сбер», «Ростелеком», «Яндекс», HH и VK, попросила Минцифры упростить использование обезличенной персональной информации для разработки и обучения нейросетей.

Сейчас любое алгоритмическое преобразование персональных данных считается обезличиванием.

Даже если технология практически исключает возможность установить личность человека, полученный массив всё равно остаётся персональными данными со всеми сопутствующими ограничениями. Защита вроде бы сработала, а юридический хвост никуда не делся.

АБД, по данным КоммерсантЪ, предлагает выделить технологии повышения приватности — Privacy Enhancing Technologies, или PETs — в отдельную категорию. Они позволяют обрабатывать, передавать и хранить информацию без раскрытия личности. Если риск идентификации равен нулю или составляет малые доли процента, такие данные предлагается использовать для ИИ без согласия граждан.

Обработка при этом должна проходить в России, российскими компаниями и только для разработки, обучения и применения ИИ. Кроме того, ассоциация предлагает ввести доверенных посредников — аккредитованные организации, которые будут хранить обезличенные массивы и предоставлять к ним доступ. Данные также хотят разделить на бесплатные, необходимые для исполнения закона, и платные — для коммерческих задач.

Участники рынка объясняют инициативу просто: российских датасетов мало, а большая их часть заперта внутри крупных экосистем. Собственные и партнёрские массивы уже не закрывают аппетиты современных моделей, особенно специализированных корпоративных решений.

Альтернативой остаются синтетические данные — искусственно созданные наборы без сведений о реальных людях. Но полностью заменить ими отраслевую статистику, поведенческие закономерности и другие ценные выборки получится не всегда.

Теперь мяч у Минцифры, которое на обращение пока не ответило. Бигтех тем временем даёт понять: без свежих данных российский ИИ далеко не уедет, сколько вычислительных мощностей ему ни подбрасывай.

WhatsApp научится превращать речь в текст, голосовые можно не отправлять

WhatsApp (принадлежит корпорации Meta, признанной экстремистской и запрещённой в России) готовит функцию для тех, кто любит говорить, но не хочет мучить собеседников пятиминутными голосовыми. Пользователь сможет продиктовать сообщение, проверить получившийся текст и отправить его как обычную реплику в чате.

Новинку обнаружили специалисты WABetaInfo в WhatsApp Beta для Android версии 2.26.37.8.

В строке ввода появится отдельная кнопка диктовки. После её нажатия приложение начнёт слушать пользователя и переводить речь в текст. Результат можно будет отредактировать или вообще удалить.

Функция должна работать в личных переписках, группах и каналах. Получатель увидит обычное текстовое сообщение без аудиозаписи и отметки о том, что текст был надиктован.


Распознавание речи планируют выполнять прямо на смартфоне с помощью загружаемых языковых пакетов. Поэтому запись не придётся отправлять сторонним сервисам, а диктовка сможет работать даже без интернета. Тот же принцип WhatsApp уже использует для расшифровки входящих голосовых сообщений.

Функция находится в разработке и недоступна даже участникам бета-тестирования. Meta её официально не анонсировала, сроки запуска неизвестны, а сам эксперимент ещё может не добраться до стабильной версии приложения.

Но идея здравая: говорить обычно быстрее, чем печатать, а читать текст окружающим всё-таки удобнее, чем слушать очередное голосовое.

RSS: Новости на портале Anti-Malware.ru