Local model indirme/çalıştırma ve geliştirici deneyimi odaklı.
Tek bir token/s ekran görüntüsüyle üç motor kıyaslanamaz. Ollama kolay local kullanım, vLLM yüksek throughput/OpenAI-compatible serving, SGLang ise gelişmiş runtime ve prefix/cache optimizasyonlarıyla farklı hedeflere oynar. Aynı model+quant+GPU olmadan performans rakamı yayınlamıyoruz.
Benchmark generator gerçek sonuç üretmez; test protokolü üretir. Sonuç hücrelerini yalnız aynı model dosyası, quantization, context, GPU, driver ve sıcaklık koşullarında yapılan ölçümle doldurun.
Tek geliştirici/local API için Ollama sadelikte öne çıkabilir. Çoklu kullanıcı OpenAI-compatible API için vLLM güçlü adaydır. Prefix-heavy agent/RAG ve ileri serving optimizasyonlarında SGLang test edilmeye değerdir. Nihai karar kendi prompt dağılımınızla benchmark edilmelidir.
Tek geliştirici/local API için Ollama sadelikte öne çıkabilir. Çoklu kullanıcı OpenAI-compatible API için vLLM güçlü adaydır. Prefix-heavy agent/RAG ve ileri serving optimizasyonlarında SGLang test edilmeye değerdir. Nihai karar kendi prompt dağılımınızla benchmark edilmelidir.
Ollama, vLLM ve SGLang’i aynı GPU/model üzerinde adil karşılaştırın. Kurulum kolaylığı, OpenAI API, batching, prefix cache, multi-GPU ve tekrarlanabilir benchmark matrisi.
Local model indirme/çalıştırma ve geliştirici deneyimi odaklı.
Continuous batching ve OpenAI-compatible serving odaklı.
Radix/prefix caching ve gelişmiş serving optimizasyonları sunar.
Motor değişirken hardware/model/quant sabit kalmalıdır.
Local chat, tek API client, 100 eşzamanlı kullanıcı veya agentic RAG aynı serving motorundan aynı şeyi beklemez.
| Profil | Öncelik | İlk aday |
|---|---|---|
| Local developer | Kurulum sadeliği | Ollama |
| OpenAI API / multi-user | Throughput + batching | vLLM |
| Agent/RAG repeated prefix | Prefix/cache verimi | SGLang / vLLM |
| Model lab | Hızlı model deneme | Ollama / vLLM |
“OpenAI-compatible” her vendor özelliğinin birebir aynı olduğu anlamına gelmez. Chat, Responses, embeddings, tool calling ve structured output gereksinimlerini ayrı smoke test edin.
KV cache allocation, CUDA graphs, kernels ve runtime overhead motorlara göre değişebilir. Model “sığıyor” testi yerine peak VRAM + OOM margin ölçün.
watch -n 0.5 nvidia-sminvidia-smi --query-compute-apps=pid,process_name,used_memory --format=csvAgent system prompt, tool schemas ve RAG context tekrar ediyorsa prefix cache davranışı gerçek production kazancını belirleyebilir.
| Test | Input pattern |
|---|---|
| Cold | Her request farklı 4k |
| Warm prefix | Aynı 4k prefix + 256 unique |
| RAG | 8k ortak docs + soru |
Engine A’ya kısa prompt, Engine B’ye uzun prompt verirseniz sonuç geçersizdir. Prompt corpus SHA256 ile sabitlenebilir.
sha256sum benchmark-prompts.jsonlnvidia-smi --query-gpu=name,driver_version,memory.total,temperature.gpu,power.draw --format=csv2×GPU throughput / 1×GPU throughput oranı ve latency değişimini birlikte verin. Yalnız toplam tok/s interconnect overhead’i gizleyebilir.
| Engine | 1 GPU tok/s | 2 GPU tok/s | Scaling |
|---|---|---|---|
| Ollama | — | — | — |
| vLLM | — | — | — |
| SGLang | — | — | — |
Deployment sadeliği, API compatibility, p95 latency, throughput, VRAM headroom, observability ve upgrade riski için kendi ağırlığınızı verin.
Concurrency ve prompt profilini seçin; tekrarlanabilir test matrisi oluşturun.
Eka Sunucu GPU sunucusunda aynı model/driver koşuluyla Ollama, vLLM ve SGLang staging benchmark ortamı kurarak gerçek karar verisi üretebilirsiniz.
Rehber hazırlanırken esas alınan birincil dokümantasyon ve teknik kaynaklar.
İlgili altyapı ve uygulama rehberleriyle devam edin.
LLM Serving Karşılaştırma
Model, quantization, GPU, prompt ve concurrency sabit olmadan doğru cevap yoktur. vLLM yüksek throughput serving için tasarlanmıştır; yine de kendi workload’unuzda ölçün.
Agent/RAG gibi tekrar eden prefix ve ileri serving optimizasyonlarının önemli olduğu workload’larda aday olarak test edilmelidir.
Engine format desteği farklı olabilir. Adil kıyas için mümkün olduğunca eşdeğer model ağırlığı/quantization kullanın ve format farkını raporlayın.
Hayır. Tekrarlanabilir test koşullarını üretir; gerçek sonuç GPU sunucuda ölçülmelidir.