ФБР планирует увеличить базу распознавания лиц до 52 млн изображений

ФБР планирует увеличить базу распознавания лиц до 52 млн изображений

Фонд электронных рубежей опубликовал новые документы о биометрической базе данных Next Generation Identification (NGI), которая разрабатывается по заказу ФБР и должна начать работу летом 2014 года. Документы получены в ходе судебного процесса против ФБР по поводу засекречивания информации об этом проекте.



В соответствии с документами, базу NGI уже в следующем году планируют расширить до 52 млн индивидуальных записей. В перспективе она может содержать биометрические данные на треть населения США. ФБР намерено получить часть информации из «гражданских источников», то есть для распознавания лиц людей, которые, возможно, никогда не совершали преступлений.

Фонд электронных рубежей предупреждает, что автоматическое распознавание лиц в таком масштабе представляет реальную угрозу для неприкосновенности частной жизни всех американцев, пишет habrahabr.ru

NGI создаётся на основе имеющейся базы с отпечатками пальцев 100 млн человек. Система следующего поколения использует для биометрической идентификации не только отпечатки, но и результаты сканирования радужной оболочки глаза, распознавание лиц и прочие методы. В ФБР биометрическая информация привязана к личному досье гражданина с указанием имени, домашнего адреса, номера водительского удостоверения, иммиграционного статуса, возраста, этнической принадлежности и т.д. Доступ к базе имеют другие федеральные агентства, а также около 18 000 региональных подразделений правоохранительных органов.

Документы показывают, что в 2012 году в NGI хранилось 13,6 млн изображений для автоматического распознавания лиц от 7 до 8 млн человек, в середине 2013 года размер БД вырос до 16 млн изображений, а новые документы показывают, что NGI способна добавлять до 55 000 новых изображений в день и обрабатывать десятки тысяч поисковых запросов в сутки.

По плану ФБР, в следующем году база для распознавания лиц может вырасти до 52 млн фотографий, из которых 46 млн «криминальных изображений», 4,3 млн «гражданских изображений» и около 1 млн изображений из неназываемых источников, в том числе из «новых репозиториев».

Сбор фотографий граждан уже начался: во многих организациях, которые требуют специального допуска, у людей берут не только отпечаток пальца, но и фотографируют. Информацию отправляют в ФБР.

«Раньше ФБР никогда не связывало криминальную и гражданскую базы данных отпечатков пальцев. Таким образом, любой поисковый запрос по первой БД не поступал во вторую, — пишет Фонд электронных рубежей. — С внедрением NGI всё изменится. Теперь каждой записи, уголовной или нет, будет присвоен универсальный контрольный номер (UCN), и каждый запрос будет запущен для всех записей в базе». Это означает, что даже гражданина без криминальной истории могут случайно распознать в качестве подозреваемого по любому уголовному делу. Независимые исследования показывают, что вероятность ложных срабатываний существенно возрастает при увеличении размера выборки, а с 52 млн фотографий выборка будет очень большой. 

Подрядчиком по внедрению NGI является компания MorphoTrust (бывшая L-1 Identity Solutions), которая разработала и поддерживает работу крупнейшей в мире системы распознавания лиц Госдепартамента США. Она содержит фотографии более 244 млн граждан преимущественно иностранных государств, которые когда-либо подавали заявления на американскую визу или паспорт.

Права авторов при обучении ИИ уточнят в подзаконных актах осенью

Новый закон о поддержке развития искусственного интеллекта не отменяет Гражданский кодекс и не превращает произведения авторов в бесплатный корм для нейросетей. Об этом заявила советник президента России Елена Ямпольская. Закон, подписанный президентом 26 июля, разрешает использовать общедоступные и правомерно опубликованные материалы для обучения российских алгоритмов ИИ.

Однако правообладатель может закрыть свои работы от такой обработки техническими средствами. Бесконтрольно загружать в модели всё, до чего дотянулся парсер, нельзя.

Как именно будет работать этот механизм, пока предстоит решить. Подзаконные акты, по данным «Ведомостей», начнут появляться осенью. При их подготовке власти обещают учесть опасения творческих отраслей, представители которых предупреждали об обесценивании интеллектуальной собственности.

Эксперты тем временем предлагают несколько способов помирить нейросети с авторами. Среди них — отказ от использования произведений по требованию правообладателя, коллективное лицензирование и отчисление части прибыли ИИ-продуктов в компенсационный фонд.

В РАНХиГС считают, что разработчиков генеративных моделей стоит обязать вести закрытые реестры обучающих данных и показывать их регуляторам. Так можно будет понять, чьи произведения попали в датасет, не раскрывая коммерческую тайну.

Юрист Михаил Семенов предлагает разделять сценарии. Если модель копирует голос актёра, манеру художника или тексты конкретного писателя, потребуется прямой договор и выплаты. При массовом обучении на миллиардах материалов искать каждого автора нереально — здесь пригодился бы аналог авторского общества для ИИ.

В отрасли есть и более жёсткий взгляд: чрезмерные ограничения могут ударить и по экономике, и по культуре. Поэтому властям предстоит настроить систему так, чтобы модели не остались голодными, а авторы — с красивым обещанием вместо денег.

RSS: Новости на портале Anti-Malware.ru