В даркнете продают базу ПДн на 4 млн строк, якобы Минздрава Татарстана

В даркнете продают базу ПДн на 4 млн строк, якобы Минздрава Татарстана

В даркнете продают базу ПДн на 4 млн строк, якобы Минздрава Татарстана

На одном из теневых форумов появилось объявление о продаже данных жителей Татарстана, обращавшихся в больницы. По словам автора русскоязычного поста, база была украдена у Министерства здравоохранения республики.

К продаже суммарно предложено 4,3 млн записей, актуальных на конец 2023 года. Базу можно купить целиком и по частям; возможен также поиск отдельных записей с целью проверки.

Выложенный в качестве образца фрагмент (текстовый файл) содержит 2007 строк с такой информацией:

  • ФИО;
  • дата рождения;
  • паспортные данные;
  • СНИЛС;
  • телефон;
  • домашний адрес;
  • название медучреждения (во всех записях фрагмента — «Нижнекамская центральная районная многопрофильная больница»);
  • диагноз.

 

В пресс-службе Минздрава Татарстана подтвердили утечку данных, но в комментарии для СМИ также подчеркнули, что инцидент не имеет большого масштаба:

«По предварительным данным, незаконным путем был получен узкий сегмент записей о пациентах одной из центральных районных больниц. Вероятно, это может быть связано с нарушениями со стороны отдельных сотрудников. В данный момент проводится служебная проверка, с привлечением специалистов по информационной безопасности».

Зарубежные нейросети тайком учили на сотнях песен Басты, Билана и Лазарева

Российские артисты незаметно отправились обучать нейросети, сотни их песен нашли в открытых зарубежных датасетах. И нет, разрешения у правообладателей, похоже, никто не спрашивал. Аналитики Национальной федерации музыкальной индустрии изучили базы Laion-Disco-12M и Sleeping-D 9M через проект AI Watchdog журнала The Atlantic.

В них хранятся миллионы композиций с YouTube, а во втором наборе — ещё и тексты с Genius, пишут «Ведомости».

Главным преподавателем для ИИ оказался Баста: в датасетах нашли 193 и 104 его трека. Следом идут Feduk — 150 и 91 композиция, Сергей Лазарев — 144 и 118, Дима Билан — 140 и 119, а также группа «Звери» — 135 и 41. В списке засветились Леонид Агутин, Егор Крид, Ваня Дмитриенко и другие исполнители. Туда же попали десятки видеороликов с участием российских артистов.

Само наличие песни в базе ещё не доказывает, что конкретная нейросеть действительно на ней училась. Но вероятность такого сценария The Atlantic оценивает как высокую.

Представители музыкальной индустрии утверждают, что ни зарубежные, ни российские разработчики ИИ за лицензиями к ним не обращались. Рассуждения, видимо, были такие: если контент лежит в открытом интернете, значит, его будто бы можно молча забрать в учебник для алгоритма. Иногда источником могут становиться и пиратские площадки.

Тем временем легальные сделки на мировом рынке уже появляются: Warner Music договорилась с Suno, а Universal Music Group — с Udio. Но пока это редкие исключения.

По оценке НИУ ВШЭ, совокупные потери авторов и правообладателей из-за генеративного контента за 2025-2030 годы могут достигнуть 1 трлн рублей. Российская музыкальная индустрия теперь требует прозрачного лицензирования.

RSS: Новости на портале Anti-Malware.ru