Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
EMBEDDING · RERANKER · TEI · RAG · VECTOR

Embedding ve Reranker Sunucusu: LLM GPU'sunu Her RAG İsteğinde Embedding İçin Harcamayın

RAG pipeline'da embedding ve reranking, LLM generation'dan farklı inference profilleridir. Ayrı TEI servisi embedding batch'lerini ve cross-encoder reranker isteklerini bağımsız ölçeklemenizi sağlar. Böylece expensive generative GPU yalnız generation için kullanılabilir.

protocol / 2026
01Embeddings
02Reranking
03Batch
04OpenAI /v1
Güncellendi · 18.08.2026
01
Bu sayfada

Tek servis hem embedding hem reranking yapabilir mi?

Hugging Face Text Embeddings Inference embedding modellerinin yanında reranker/sequence classification modellerini de destekler. TEI OpenAI-compatible `/v1/embeddings` endpoint'i sunar; reranker modeli için ayrı deployment/endpoint kullanmak kapasite ve model lifecycle yönetimini kolaylaştırır.

Bu sayfadaEmbedding ve Reranker Sunucusu: LLM GPU'sunu Her RAG İsteğinde Embedding İçin Harcamayın
01
RAG retrieval akışı

Embedding ve reranker RAG zincirinde nerede çalışır?

Query önce embedding'e çevrilir, vector DB adayları döndürür, reranker query-document çiftlerini yeniden skorlar ve en iyi context LLM'e gönderilir.

01Query
02Embedding Service
03Vector DB
04Reranker
05LLM
02
İki inference profili

Embedding ve reranker aynı throughput metriğiyle ölçülmez

Embedding batch throughput token/input hacmine; reranker ise query × candidate pair sayısına duyarlıdır.

EmbeddingText → vectorBatch inputIndex + query
RerankerQuery+doc → scoreCandidate pairOnline latency
LLMContext → tokensGenerationEn pahalı
03
Batch ve kapasite

Indexing batch ile online query latency hedefini birbirinden ayırın

Milyonlarca dokümanı indexlerken büyük batch verimli olabilir; online query'de düşük latency için daha küçük batch ve ayrı replica gerekebilir.

Offline indexing pool
Online query replica
Max input tokens
Vector dimension
Candidate count
Rerank top-k
04
TEI API testi

Embedding endpoint'ini OpenAI uyumlu API ile doğrulayın

Model adı deployment tarafından belirlenir; örneği kendi endpoint'inize göre değiştirin.

Komut 1
curl -s http://127.0.0.1:8080/info | head
Komut 2
curl -s http://127.0.0.1:8080/v1/embeddings -H 'Content-Type: application/json' -d '{"input":"sunucu performansı","model":"text-embeddings-inference"}' | head
Komut 3
nvidia-smi
Komut 4
ss -lntp | grep ':8080'
05
API ve model

Embedding servisini de LLM API kadar koruyun

Embedding endpoint kullanıcı metnini işler; hassas belge/query içeriği log ve telemetry'de sızabilir. Private network, auth ve log-redaction uygulayın.

Private endpoint
Auth
Input log redaction
Model version pin
Health check
Autoscale online pool
Resmî dokümantasyon

Resmî kaynaklar

Hugging FaceText Embeddings Inference Quick Tourhuggingface.coOllamaEmbeddingsdocs.ollama.comQdrantDocumentationqdrant.tech
FAQ

Sık sorulan sorular

TEI GPU şart mı?

Hayır. TEI CPU ve GPU inference destekler; model ve throughput hedefi hangi donanımın uygun olduğunu belirler.

Reranker neden vector search sonrası kullanılır?

Vector search hızlı aday üretir; cross-encoder reranker daha az sayıda aday üzerinde query-document ilişkisini daha ayrıntılı skorlayabilir.

TEI OpenAI embeddings endpoint sunuyor mu?

Evet. Resmî quick tour `/v1/embeddings` kullanımını OpenAI SDK/curl ile gösterir.

EKA YAZILIM VE BİLİŞİM SİSTEMLERİ

Embedding ve reranker kapasitesini belge sayısı değil token hacmi ve candidate sayısına göre planlayalım

Embedding modeli, günlük document token, query RPS, candidate top-k ve reranker modelini iletin; CPU/GPU replica planını çıkaralım.

WhatsApp'tan Sorun0850 307 34 58
WhatsAppHemen Arayınİncele
Top