Новая коллекция слитых данных бьет рекорд Троя Ханта

Новая коллекция слитых данных бьет рекорд Троя Ханта

Новая коллекция слитых данных бьет рекорд Троя Ханта

Неизвестные злоумышленники собрали воедино все утечки, произошедшие за последние несколько лет с такими компаниями, как Dropbox и LinkedIn. В итоге получилась база данных, насчитывающая 2,2 миллиарда уникальных имен пользователей и связанных с ними паролей.

Удивительно, что собравшие такую крупную базу данных киберпреступники распространяют ее бесплатно на форумах хакерской тематики, а также на торрент-сайтах. Исследователи назвали новую коллекцию «Collections #2–5».

Название является прямой отсылкой к обнаруженной в прошлом месяце крупнейшей слитой базе электронных адресов и паролей, которую обнаружил Трой Хант — «Collection #1».

«Collections #2–5» прежде всего поражает своими объемами — весит она 845 Гб, а общее число записей в ней равняется 25 миллиардам.

Крис Руланд из Phosphorus.io сообщил, что это самая крупная коллекция слитых данных, которую ему доводилось наблюдать.

Напомним, что найденная Хантом «Collection #1» весила 87 Гбайт, она состояла из 12 000 файлов и была обнаружена на сервисе для загрузки файлов MEGA.

Подпишитесь на новости

Yandex B2B Tech объединила полнотекстовый и векторный поиск в одном запросе

Найти точный номер документа и одновременно разобраться, что пользователь имел в виду, — теперь обе задачи можно решать в YDB. Yandex B2B Tech добавила в базу данных гибридный поиск, объединяющий полнотекстовый и векторный подходы.

Как объясняют разработчики в блоге YDB, два вида поиска дополняют друг друга.

Например, в запросе о выплате по страховке номер полиса нужно найти точно, а описание страхового случая — сопоставить по смыслу, даже если в документах использованы другие формулировки.

Полнотекстовый поиск отвечает за слова, названия и коды, векторный — за смысловую близость. YDB объединяет результаты и ранжирует их внутри одного SQL-запроса.

Практический бонус для компаний: данные остаются в одной базе. Для такого сценария не нужно отдельно поддерживать поисковый движок и векторную базу, а затем следить, чтобы информация между ними не разъехалась. Индексы обновляются вместе с данными в рамках одной транзакции.

Технология рассчитана на чат-ботов, рекомендательные сервисы и ИИ-ассистентов, которым мало простого совпадения слов. Особенно когда приходится искать по технической информации, где точный код детали и человеческое описание проблемы одинаково важны.

Гибридный поиск доступен в корпоративной версии YDB 26.3 для развёртывания на собственной инфраструктуре и в облачном Managed Service for YDB.

RSS: Новости на портале Anti-Malware.ru