Автоматизация продаж2 мин чтенияDIL LEAD

Как мы вынесли семантический поиск на обычный сервер без видеокарты, облака и выделенной поисковой системы

Нужен семантический поиск в закрытом контуре без GPU и облачных сервисов? Мы показали, как собрать его на обычном сервере, сохранив качество.

Для заказчиков, работающих в закрытом контуре без доступа к интернету и без специализированного железа, стандартные решения семантического поиска неприемлемы.

Мы поставили задачу: достичь промышленного уровня качества, убрав три ключевые зависимости — облачный API эмбеддингов, GPU и выделенную векторную базу.

Поисковый конвейер состоит из трёх компонентов: эмбеддинг запросов и документов, векторный поиск кандидатов и переранжирование для точного ранжирования. Каждый из них обычно требует GPU или отдельного сервиса, но мы проверили, где действительно нужна вычислительная мощность, а где достаточно правильного выбора алгоритма.

Компактные retrieval‑модели (e5‑base, bge‑m3) на CPU обошли большую облачную Qwen3‑Embedding‑8B по полноте, потому что они обучены специально под поиск, а не «по совместительству».

Компоненты поискового конвейера

  • Эмбеддинг

    Преобразование запросов и документов в векторное представление.

  • Векторный поиск

    Поиск ближайших векторов в памяти процесса без внешней БД.

  • Переранжирование

    Cross‑encoder (mmarco‑mMiniLMv2) уточняет релевантность кандидатов.

Этапы внедрения

  1. 01
    Выбор компактной модели

    e5‑base, экспорт в ONNX, работает на CPU без потери качества.

  2. 02
    Реализация скалярного произведения в приложении

    Перебор векторов в памяти процессора, микросекунды на запрос.

  3. 03
    Cross‑encoder для реранжирования

    mmarco‑mMiniLMv2 обрабатывает пакет из 100 кандидатов за ~1.3 с, в 30× быстрее генеративного судьи.

  4. 04
    Слияние с лексическим поиском

    Reciprocal Rank Fusion объединяет результаты векторной и полной текстовой веток.

  5. 05
    Калибровка и мониторинг

    Квантование векторов до int8, проверка конечных ответов модели‑ассистента.

Критерий

  • Стоимость
  • Задержка
  • Поддержка
  • Качество

Облако + GPU

  • Высокая
  • ≈10 мс
  • Сложная
  • Высокое

CPU внутри сервера

  • Низкая
  • ≈120 мс
  • Простая
  • Эквивалентное
0.98
Полнота
120 мс
Средняя задержка
Ускорение реранжирования
$0 / мес
Эксплуатационные затраты

Мы перенесли промышленный семантический поиск в изолированный контур, используя только CPU и открытые модели, сохранив качество и снизив стоимость владения.

Хотите узнать, как ваш B2B‑продукт может работать без GPU и облачных сервисов? Закажите бесплатный аудит у DIL LEAD и получите практический план внедрения.

Хотите обсудить свою нишу?

Напишите менеджеру DIL LEAD или подпишитесь на Telegram-канал.