Yandex B2B Tech объединила полнотекстовый и векторный поиск в одном запросе

Yandex B2B Tech объединила полнотекстовый и векторный поиск в одном запросе

Yandex B2B Tech объединила полнотекстовый и векторный поиск в одном запросе

Найти точный номер документа и одновременно разобраться, что пользователь имел в виду, — теперь обе задачи можно решать в YDB. Yandex B2B Tech добавила в базу данных гибридный поиск, объединяющий полнотекстовый и векторный подходы.

Как объясняют разработчики в блоге YDB, два вида поиска дополняют друг друга.

Например, в запросе о выплате по страховке номер полиса нужно найти точно, а описание страхового случая — сопоставить по смыслу, даже если в документах использованы другие формулировки.

Полнотекстовый поиск отвечает за слова, названия и коды, векторный — за смысловую близость. YDB объединяет результаты и ранжирует их внутри одного SQL-запроса.

Практический бонус для компаний: данные остаются в одной базе. Для такого сценария не нужно отдельно поддерживать поисковый движок и векторную базу, а затем следить, чтобы информация между ними не разъехалась. Индексы обновляются вместе с данными в рамках одной транзакции.

Технология рассчитана на чат-ботов, рекомендательные сервисы и ИИ-ассистентов, которым мало простого совпадения слов. Особенно когда приходится искать по технической информации, где точный код детали и человеческое описание проблемы одинаково важны.

Гибридный поиск доступен в корпоративной версии YDB 26.3 для развёртывания на собственной инфраструктуре и в облачном Managed Service for YDB.

Подпишитесь на новости

ТризТех запатентовала алгоритм классификации трафика для PT NGFW

Компания «ТризТех» получила патент на способ классификации сетевого трафика, который используется в PT NGFW. По словам разработчика, технология помогает сохранять производительность межсетевого экрана при росте числа правил и усложнении политик безопасности.

Задача непростая: каждую сетевую сессию нужно сопоставить с правилами по IP-адресам, портам, протоколам, URL-категориям и пользователям.

Чем больше условий, тем больше работы у процессора. Просто добавлять вычислительные мощности — далеко не единственный выход.

Запатентованный подход позволяет отказаться от последовательного перебора большого количества правил. Для разных признаков создаются отдельные поисковые индексы, а результаты представляются битовыми масками. Затем система объединяет их побитовыми операциями и выбирает подходящее правило с наивысшим приоритетом.

Архитектура также оптимизирована под векторные инструкции, обработку групп данных параллельно. По словам руководителя разработки Алексея Дядина, это снижает вычислительную нагрузку и повышает пропускную способность PT NGFW.

Есть и нюанс: сведения о сессии приходят постепенно. Адреса и порты известны рано, а прикладной протокол или категория URL могут определиться позднее. Если информации недостаточно, система сохраняет контекст и ждёт недостающих данных, избегая ненужных повторных вычислений.

Конкретных результатов сравнительных тестов в сообщении нет: патент фиксирует технический подход, а производительность оценивается на практике. «ТризТех» планирует патентовать и другие разработки для PT NGFW.

RSS: Новости на портале Anti-Malware.ru