embeddings.ru

У данных уже есть смысл.
Пусть API его найдёт.
ЗАГРУЗКА
. . .
Готово
0

Поиск который понимает смысл.

Embeddings и rerank по API. Российский контур, оплата в рублях.

Для разработчиков, интернет-магазинов и продуктовых команд, которым нужен смысловой поиск, RAG или рекомендации — но не нужна своя GPU-ферма. Два HTTP-запроса вместо ML-контура: мы держим модели и очереди, ваши данные остаются у вас.

Два шага к точной выдаче

Embeddings находят кандидатов по смыслу. Rerank перепроверяет их по исходному запросу и поднимает самые релевантные. Один API вместо собственной GPU-инфраструктуры.

Покупатель ищет «куртку на весну, чтобы не маркая». Сотрудник спрашивает «можно ли вернуть товар после вскрытия». Клиент пишет в поддержку своими словами, а не цитатой из регламента.

Поиск по совпадению слов такие запросы теряет: в карточке товара нет слова «маркая», а в регламенте — слова «вскрытие». Семантический поиск сравнивает смысл и находит нужное.

Сначала POST /v1/embeddings превращает запросы и документы в 1536-мерные L2-нормализованные векторы.

Вы храните векторы в своей базе и выполняете первичный поиск, получая небольшой список кандидатов.

Затем POST /v1/rerank получает запрос, список кандидатов и top_n, повторно оценивает документы и возвращает лучший порядок.

Мы обслуживаем модели, GPU, очереди и обновления за стабильными алиасами, поэтому публичный контракт не меняется вместе с runtime.

Что делает Embeddings API

API преобразует каждый запрос или документ в 1536-мерный L2-нормализованный вектор.

На этих векторах строят поиск по каталогу, ответы по базе знаний и регламентам, блок «похожие товары», автоматическую маршрутизацию обращений и дедупликацию карточек.

Документы, индексы, векторная база и первичный поиск остаются на вашей стороне.

Что делает Rerank API

API принимает исходный запрос, список найденных документов и обязательный параметр top_n.

В ответе кандидаты отсортированы по релевантности, а relative score помогает сравнивать их внутри одной выдачи.

Rerank не ищет по всей базе сам: он уточняет порядок после вашего первичного отбора.

Два запроса — весь API

Обычный HTTP и ключ в заголовке. Никаких SDK, очередей на вашей стороне и выгрузки данных — тексты приходят в запросе и не сохраняются.

Векторы
curl https://api.embeddings.ru/v1/embeddings \
  -H "Authorization: Bearer $KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-embedding-4b-1536",
    "input": ["куртка на весну не маркая"],
    "input_type": "query"
  }'

В ответе — 1536-мерный нормализованный вектор для вашей векторной базы.

Порядок
curl https://api.embeddings.ru/v1/rerank \
  -H "Authorization: Bearer $KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "bge-reranker-v2-m3",
    "query": "куртка на весну не маркая",
    "documents": ["...", "...", "..."],
    "top_n": 3
  }'

В ответе — кандидаты, отсортированные по релевантности к запросу.

Полные контракты, лимиты, идемпотентность и пакеты до 10 000 элементов — в документации API.

Что входит в сервис

  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server
  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server
  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server
  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server
  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server
  • Translucent semantic embedding sculpture
  • Ordered reranking sculpture
  • Enterprise GPU inference server

Вы управляете данными. Мы — моделями.

Документы, индексы, векторная база и первичный поиск остаются на вашей стороне. embeddings.ru рассчитывает векторы и rerank-оценки, обслуживает модели, GPU, очереди и обновления.

Контракты, лимиты и примеры запросов собраны в документации API, порядок расчёта — в тарифах. Нужна помощь с внедрением — подключаем поиск к вашему каталогу или базе знаний отдельным проектом.

Данные не покидают РФ
Модели и API на своём железе
Оплата в рублях
Предоплаченный баланс, без подписки
Стабильные алиасы
Контракт не меняется вместе с моделью
Пакетная обработка
До 10 000 элементов за одну заявку
Тексты не сохраняются
Синхронный запрос — только метаданные

Готово для рабочей интеграции

Ключ показывается один раз, лимиты заданы явно, сетевые повторы связываются через Idempotency-Key, а расход и баланс видны в кабинете. Под нагрузкой в восемь параллельных запросов p95 держится около 156 мс на обеих операциях.

Пакет на месяц

Купили — тратите. Эмбеддинги расходуют токены, реранк — поиски: один поиск это до пятидесяти документов в запросе.

  • Проба 490 ₽ в месяц
    Токены
    5 млн
    Поиски реранка
    2 000

    Интеграция и пилот: проиндексировать каталог и проверить выдачу на живых запросах.

  • Рабочий 1 490 ₽ в месяц
    Токены
    25 млн
    Поиски реранка
    10 000

    Поиск в проде: ежедневные запросы пользователей и регулярное обновление индекса.

  • Объём 3 900 ₽ в месяц
    Токены
    100 млн
    Поиски реранка
    40 000

    Большой каталог или база знаний, несколько проектов на одном ключе, регулярная переиндексация.

Остаток сгорает в конце периода. Докупка внутри периода складывается с остатком и продлевает срок — ранняя докупка ничего не сжигает. Нужен объём больше старшего пакета или помощь с внедрением — посчитаем отдельно.