Mevcut OpenAI SDK tabanlı uygulamaların base URL değiştirerek bağlanmasını kolaylaştırır.
vLLM’nin değeri yalnız modeli yüklemek değildir; continuous batching, KV cache yönetimi ve OpenAI-compatible endpoint’lerle aynı GPU’yu çoklu istek altında daha verimli servis etmeyi hedefler. Doğru test tek kullanıcı token/s değil concurrency altında p95 latency ve throughput’tur.
Model lisansı, tokenizer/chat template ve quantization formatı uyumlu olmadan yalnız `docker run` komutunu kopyalamayın. “Server başladı” sonucu modelin doğru cevap formatı ürettiğini kanıtlamaz.
Resmî vLLM sunucusu OpenAI-compatible Chat/Completions gibi endpoint’ler sağlar ve `vllm/vllm-openai` Docker image’iyle çalıştırılabilir. Model VRAM’e sığsa bile KV cache ve concurrency için headroom bırakın.
Resmî vLLM sunucusu OpenAI-compatible Chat/Completions gibi endpoint’ler sağlar ve `vllm/vllm-openai` Docker image’iyle çalıştırılabilir. Model VRAM’e sığsa bile KV cache ve concurrency için headroom bırakın.
vLLM OpenAI-compatible server’ı GPU sunucuda kurun. Docker image, model cache, tensor parallel, endpoint testi, concurrency, prefix cache ve gerçek benchmark metodolojisi.
Mevcut OpenAI SDK tabanlı uygulamaların base URL değiştirerek bağlanmasını kolaylaştırır.
Eşzamanlı request’leri GPU üzerinde verimli zamanlamayı hedefler.
Uzun context ve concurrency, model ağırlıkları dışında VRAM tüketir.
Tensor parallel ile model birden fazla GPU’ya bölünebilir; interconnect darboğazı ölçülmelidir.
Ağırlıklar, quantization overhead, CUDA/runtime, KV cache ve fragmentation birlikte VRAM kullanır. %100 doluluk hedefi OOM riskini büyütür.
| Bütçe | Sürücü |
|---|---|
| Weights | Parametre × bit |
| KV cache | Context × concurrency × model arch |
| Runtime | CUDA/kernels/graphs |
| Headroom | Peak/fragmentation |
Host `nvidia-smi` sağlıklı değilse container içinde çözmeye çalışmayın. Driver/CUDA compatibility ve persistence state’i önce host seviyesinde netleştirin.
nvidia-sminvidia-smi --query-gpu=name,memory.total,driver_version,pstate --format=csvdocker info | grep -i runtimedocker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smiBüyük model her redeploy’da yeniden indirilirse downtime, bandwidth ve startup süresi büyür. Hugging Face/model cache’i persistent mount kullanmalıdır.
mkdir -p /srv/vllm-cachedocker run --rm --gpus all -p 8000:8000 -v /srv/vllm-cache:/root/.cache/huggingface vllm/vllm-openai:latest --model MODEL_ID --host 0.0.0.0 --port 8000Model server hazır görünse bile tokenizer/chat template hatası ilk gerçek chat request’te ortaya çıkabilir. Basit smoke test’i deploy health gate’e ekleyin.
curl -s http://127.0.0.1:8000/v1/models | jq .curl -s http://127.0.0.1:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"MODEL_ID","messages":[{"role":"user","content":"Say only READY"}],"max_tokens":8}' | jq .İki GPU toplam VRAM’i artırır ama her workload iki kat hızlanmaz. Collective communication ve PCIe/NVLink bandwidth ölçeklenmeyi belirler.
nvidia-smi topo -mnvidia-smi nvlink --status 2>/dev/null || trueAynı uzun system prompt/RAG prefix’i tekrar eden workload cache’ten daha çok yararlanabilir. Rastgele prompt benchmark’ı bu faydayı göstermeyebilir.
1, 2, 4, 8, 16 eşzamanlı request seviyelerinde TTFT, output tok/s, p95 latency ve error rate ölçün. “En yüksek tok/s” değil SLA’nızı koruyan maksimum concurrency önemlidir.
| Concurrency | TTFT p95 | Output tok/s | Error % |
|---|---|---|---|
| 1 | — | — | — |
| 2 | — | — | — |
| 4 | — | — | — |
| 8 | — | — | — |
| 16 | — | — | — |
Eka Sunucu GPU altyapısında vLLM için model, context ve eşzamanlı request hedefinize göre tek/çoklu GPU benchmark ortamı planlayabilirsiniz.
Rehber hazırlanırken esas alınan birincil dokümantasyon ve teknik kaynaklar.
İlgili altyapı ve uygulama rehberleriyle devam edin.
vLLM API
OpenAI-compatible endpoint’leri sayesinde birçok SDK/uygulama base URL ve model adı değiştirilerek bağlanabilir; kullanılan endpoint özelliğini ayrıca doğrulayın.
Hayır. KV cache, runtime ve concurrency için ek VRAM gerekir. Context ve eşzamanlı kullanıcı hedefi capacity planına eklenmelidir.
Garanti değildir. Tensor parallel communication, model boyutu, batch ve GPU interconnect’e bağlıdır.
Resmî dokümantasyon `vllm/vllm-openai` image’ini OpenAI-compatible serving için gösterir.