Поиск который понимает смысл.
Для разработчиков, интернет-магазинов и продуктовых команд, которым нужен смысловой поиск, RAG или рекомендации — но не нужна своя GPU-ферма. Два HTTP-запроса вместо ML-контура: мы держим модели и очереди, ваши данные остаются у вас.
Два шага к точной выдаче
Embeddings находят кандидатов по смыслу. Rerank перепроверяет их по исходному запросу и поднимает самые релевантные. Один API вместо собственной GPU-инфраструктуры.
Покупатель ищет «куртку на весну, чтобы не маркая». Сотрудник спрашивает «можно ли вернуть товар после вскрытия». Клиент пишет в поддержку своими словами, а не цитатой из регламента.
Поиск по совпадению слов такие запросы теряет: в карточке товара нет слова «маркая», а в регламенте — слова «вскрытие». Семантический поиск сравнивает смысл и находит нужное.
Сначала POST /v1/embeddings превращает запросы и документы в 1536-мерные L2-нормализованные векторы.
Вы храните векторы в своей базе и выполняете первичный поиск, получая небольшой список кандидатов.
Затем POST /v1/rerank получает запрос, список кандидатов и top_n, повторно оценивает документы и возвращает лучший порядок.
Мы обслуживаем модели, GPU, очереди и обновления за стабильными алиасами, поэтому публичный контракт не меняется вместе с runtime.
Что делает Embeddings API
API преобразует каждый запрос или документ в 1536-мерный L2-нормализованный вектор.
На этих векторах строят поиск по каталогу, ответы по базе знаний и регламентам, блок «похожие товары», автоматическую маршрутизацию обращений и дедупликацию карточек.
Документы, индексы, векторная база и первичный поиск остаются на вашей стороне.
Что делает Rerank API
API принимает исходный запрос, список найденных документов и обязательный параметр top_n.
В ответе кандидаты отсортированы по релевантности, а relative score помогает сравнивать их внутри одной выдачи.
Rerank не ищет по всей базе сам: он уточняет порядок после вашего первичного отбора.
Два запроса — весь API
Обычный HTTP и ключ в заголовке. Никаких SDK, очередей на вашей стороне и выгрузки данных — тексты приходят в запросе и не сохраняются.
curl https://api.embeddings.ru/v1/embeddings \
-H "Authorization: Bearer $KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-embedding-4b-1536",
"input": ["куртка на весну не маркая"],
"input_type": "query"
}'
В ответе — 1536-мерный нормализованный вектор для вашей векторной базы.
curl https://api.embeddings.ru/v1/rerank \
-H "Authorization: Bearer $KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "bge-reranker-v2-m3",
"query": "куртка на весну не маркая",
"documents": ["...", "...", "..."],
"top_n": 3
}'
В ответе — кандидаты, отсортированные по релевантности к запросу.
Полные контракты, лимиты, идемпотентность и пакеты до 10 000 элементов — в документации API.
Что входит в сервис
Вы управляете данными. Мы — моделями.
Документы, индексы, векторная база и первичный поиск остаются на вашей стороне. embeddings.ru рассчитывает векторы и rerank-оценки, обслуживает модели, GPU, очереди и обновления.
Контракты, лимиты и примеры запросов собраны в документации API, порядок расчёта — в тарифах. Нужна помощь с внедрением — подключаем поиск к вашему каталогу или базе знаний отдельным проектом.
Готово для рабочей интеграции
Ключ показывается один раз, лимиты заданы явно, сетевые повторы связываются через Idempotency-Key, а расход и баланс видны в кабинете. Под нагрузкой в восемь параллельных запросов p95 держится около 156 мс на обеих операциях.
Пакет на месяц
Купили — тратите. Эмбеддинги расходуют токены, реранк — поиски: один поиск это до пятидесяти документов в запросе.
-
Проба
490 ₽
в месяц
- Токены
- 5 млн
- Поиски реранка
- 2 000
Интеграция и пилот: проиндексировать каталог и проверить выдачу на живых запросах.
-
Рабочий
1 490 ₽
в месяц
- Токены
- 25 млн
- Поиски реранка
- 10 000
Поиск в проде: ежедневные запросы пользователей и регулярное обновление индекса.
-
Объём
3 900 ₽
в месяц
- Токены
- 100 млн
- Поиски реранка
- 40 000
Большой каталог или база знаний, несколько проектов на одном ключе, регулярная переиндексация.
Остаток сгорает в конце периода. Докупка внутри периода складывается с остатком и продлевает срок — ранняя докупка ничего не сжигает. Нужен объём больше старшего пакета или помощь с внедрением — посчитаем отдельно.