Embedding- und Reranker-Server: LLM-GPU nicht für jeden RAG-Embedding-Request verschwenden
Embedding und Reranking haben andere Inference-Profile als LLM-Generation. Separater TEI-Service skaliert Embedding-Batches und Cross-Encoder-Reranking unabhängig; teure Generative-GPU bleibt für Generation.
Kann ein Inference-Stack Embeddings und Reranking bedienen?
Hugging Face TEI unterstützt Embedding- sowie Reranker/Sequence-Classification-Modelle und bietet `/v1/embeddings`. Separate Reranker-Deployments vereinfachen Kapazität und Lifecycle.
Auf dieser SeiteEmbedding- und Reranker-Server: LLM-GPU nicht für jeden RAG-Embedding-Request verschwenden
01
RAG-Retrieval-Fluss
Wo Embedding und Reranking in RAG sitzen
Query wird embedded, Vector DB liefert Kandidaten, Reranker bewertet Query-Dokument-Paare neu und bestes Context geht zum LLM.