20 млн записей идентификационных данных россиян были найдены в Сети

20 млн записей идентификационных данных россиян были найдены в Сети

20 млн записей идентификационных данных россиян были найдены в Сети

Исследователи наткнулись на незащищённый кластер Elasticsearch, содержащий идентификационную и налоговую информацию россиян. В результате любой желающий мог получить доступ к этим данным, так как они хранились в виде простого текста.

Такой вопиющий слив информации обнаружили эксперты компании Comparitech и Боб Дьяченко. 20 миллионов записей налоговой отчётности, принадлежащих гражданам России, были абсолютно ничем не защищены.

«База данных с 20 млн записей налоговой отчётности была найдена на незащищённом сервере. Любой мог получить к ней доступ через браузер», — пишет команда Comparitech.

Comparitech вместе с Бобом Дьяченко расследовали эту утечку. Примечательно, что владелец базы находился на Украине, он вывел базу в офлайн после сообщения Дьяченко.

Впервые эту базу поисковики проиндексировали в мае 2018 года. Исследователи нашли её 17 сентября 2019 года, а 20 сентября её убрали из общего доступа.

В таких условиях невозможно вычислить, успел ли кто-нибудь собрать эти конфиденциальные данные. Личность владельца базы эксперты раскрывать не стали.

В основном данные принадлежали жителям Москвы и области. Среди них можно было найти: полное имя, адрес, место жительства, номер паспорта, номер телефона, ИНН, имя работодателя и его телефон, налоговые расчёты.

Подпишитесь на новости

Yandex B2B Tech объединила полнотекстовый и векторный поиск в одном запросе

Найти точный номер документа и одновременно разобраться, что пользователь имел в виду, — теперь обе задачи можно решать в YDB. Yandex B2B Tech добавила в базу данных гибридный поиск, объединяющий полнотекстовый и векторный подходы.

Как объясняют разработчики в блоге YDB, два вида поиска дополняют друг друга.

Например, в запросе о выплате по страховке номер полиса нужно найти точно, а описание страхового случая — сопоставить по смыслу, даже если в документах использованы другие формулировки.

Полнотекстовый поиск отвечает за слова, названия и коды, векторный — за смысловую близость. YDB объединяет результаты и ранжирует их внутри одного SQL-запроса.

Практический бонус для компаний: данные остаются в одной базе. Для такого сценария не нужно отдельно поддерживать поисковый движок и векторную базу, а затем следить, чтобы информация между ними не разъехалась. Индексы обновляются вместе с данными в рамках одной транзакции.

Технология рассчитана на чат-ботов, рекомендательные сервисы и ИИ-ассистентов, которым мало простого совпадения слов. Особенно когда приходится искать по технической информации, где точный код детали и человеческое описание проблемы одинаково важны.

Гибридный поиск доступен в корпоративной версии YDB 26.3 для развёртывания на собственной инфраструктуре и в облачном Managed Service for YDB.

RSS: Новости на портале Anti-Malware.ru