Как мы вынесли семантический поиск на обычный сервер без видеокарты, облака и выделенной поисковой системы
Нужен семантический поиск в закрытом контуре без GPU и облачных сервисов? Мы показали, как собрать его на обычном сервере, сохранив качество.
Для заказчиков, работающих в закрытом контуре без доступа к интернету и без специализированного железа, стандартные решения семантического поиска неприемлемы.
Мы поставили задачу: достичь промышленного уровня качества, убрав три ключевые зависимости — облачный API эмбеддингов, GPU и выделенную векторную базу.
Поисковый конвейер состоит из трёх компонентов: эмбеддинг запросов и документов, векторный поиск кандидатов и переранжирование для точного ранжирования. Каждый из них обычно требует GPU или отдельного сервиса, но мы проверили, где действительно нужна вычислительная мощность, а где достаточно правильного выбора алгоритма.
Компактные retrieval‑модели (e5‑base, bge‑m3) на CPU обошли большую облачную Qwen3‑Embedding‑8B по полноте, потому что они обучены специально под поиск, а не «по совместительству».
Компоненты поискового конвейера
- Эмбеддинг
Преобразование запросов и документов в векторное представление.
- Векторный поиск
Поиск ближайших векторов в памяти процесса без внешней БД.
- Переранжирование
Cross‑encoder (mmarco‑mMiniLMv2) уточняет релевантность кандидатов.
Этапы внедрения
- 01Выбор компактной модели
e5‑base, экспорт в ONNX, работает на CPU без потери качества.
- 02Реализация скалярного произведения в приложении
Перебор векторов в памяти процессора, микросекунды на запрос.
- 03Cross‑encoder для реранжирования
mmarco‑mMiniLMv2 обрабатывает пакет из 100 кандидатов за ~1.3 с, в 30× быстрее генеративного судьи.
- 04Слияние с лексическим поиском
Reciprocal Rank Fusion объединяет результаты векторной и полной текстовой веток.
- 05Калибровка и мониторинг
Квантование векторов до int8, проверка конечных ответов модели‑ассистента.
Критерий
- Стоимость
- Задержка
- Поддержка
- Качество
Облако + GPU
- Высокая
- ≈10 мс
- Сложная
- Высокое
CPU внутри сервера
- Низкая
- ≈120 мс
- Простая
- Эквивалентное
Мы перенесли промышленный семантический поиск в изолированный контур, используя только CPU и открытые модели, сохранив качество и снизив стоимость владения.
Хотите узнать, как ваш B2B‑продукт может работать без GPU и облачных сервисов? Закажите бесплатный аудит у DIL LEAD и получите практический план внедрения.
Хотите обсудить свою нишу?
Напишите менеджеру DIL LEAD или подпишитесь на Telegram-канал.