Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
Son teknik kontrol · 17.08.2026 · vLLM API

vLLM API Sunucusu: Local Modeli OpenAI Uyumlu Servise Çevirmek

vLLM’nin değeri yalnız modeli yüklemek değildir; continuous batching, KV cache yönetimi ve OpenAI-compatible endpoint’lerle aynı GPU’yu çoklu istek altında daha verimli servis etmeyi hedefler. Doğru test tek kullanıcı token/s değil concurrency altında p95 latency ve throughput’tur.

Üretim notu

Model lisansı, tokenizer/chat template ve quantization formatı uyumlu olmadan yalnız `docker run` komutunu kopyalamayın. “Server başladı” sonucu modelin doğru cevap formatı ürettiğini kanıtlamaz.

vllm kurulumuvllm openai apivllm gpu server
TEKNİK UYGULAMA PROFİLİ
EKA CORE
vLLM API

Resmî vLLM sunucusu OpenAI-compatible Chat/Completions gibi endpoint’ler sağlar ve `vllm/vllm-openai` Docker image’iyle çalıştırılabilir. Model VRAM’e sığsa bile KV cache ve concurrency için headroom bırakın.

OpenAIUyumlu API
Kontrol
BatchContinuous batching
Kontrol
KVContext belleği
Kontrol
TPMulti-GPU
Kontrol
Teknik rehber · production odaklı · resmî kaynaklar
Kısa cevap

Resmî vLLM sunucusu OpenAI-compatible Chat/Completions gibi endpoint’ler sağlar ve `vllm/vllm-openai` Docker image’iyle çalıştırılabilir. Model VRAM’e sığsa bile KV cache ve concurrency için headroom bırakın.

01

Teknik kapsam ve önemli noktalar

vLLM OpenAI-compatible server’ı GPU sunucuda kurun. Docker image, model cache, tensor parallel, endpoint testi, concurrency, prefix cache ve gerçek benchmark metodolojisi.

OpenAIUyumlu API

Mevcut OpenAI SDK tabanlı uygulamaların base URL değiştirerek bağlanmasını kolaylaştırır.

BatchContinuous batching

Eşzamanlı request’leri GPU üzerinde verimli zamanlamayı hedefler.

KVContext belleği

Uzun context ve concurrency, model ağırlıkları dışında VRAM tüketir.

TPMulti-GPU

Tensor parallel ile model birden fazla GPU’ya bölünebilir; interconnect darboğazı ölçülmelidir.

Bu sayfada

  1. 1. Model dosyası değil serving VRAM bütçesi çıkarın
  2. 2. GPU ve driver’ı container’dan önce doğrulayın
  3. 3. Model cache’i ephemeral container filesystem’a bırakmayın
  4. 4. Önce `/v1/models`, sonra Chat Completions testi yapın
  5. 5. Tensor parallel için NVLink/PCIe topolojisini hesaba katın
  6. 6. Prefix cache avantajını gerçek prompt tekrar oranıyla ölçün
  7. 7. Concurrency merdiveniyle saturation noktasını bulun
  8. Sık sorulan sorular
02

1. Model dosyası değil serving VRAM bütçesi çıkarın

Ağırlıklar, quantization overhead, CUDA/runtime, KV cache ve fragmentation birlikte VRAM kullanır. %100 doluluk hedefi OOM riskini büyütür.

BütçeSürücü
WeightsParametre × bit
KV cacheContext × concurrency × model arch
RuntimeCUDA/kernels/graphs
HeadroomPeak/fragmentation
03

2. GPU ve driver’ı container’dan önce doğrulayın

Host `nvidia-smi` sağlıklı değilse container içinde çözmeye çalışmayın. Driver/CUDA compatibility ve persistence state’i önce host seviyesinde netleştirin.

Komut
nvidia-smi
Komut
nvidia-smi --query-gpu=name,memory.total,driver_version,pstate --format=csv
Komut
docker info | grep -i runtime
Komut
docker run --rm --gpus all nvidia/cuda:12.8.0-base-ubuntu24.04 nvidia-smi
04

3. Model cache’i ephemeral container filesystem’a bırakmayın

Büyük model her redeploy’da yeniden indirilirse downtime, bandwidth ve startup süresi büyür. Hugging Face/model cache’i persistent mount kullanmalıdır.

Komut
mkdir -p /srv/vllm-cache
Komut
docker run --rm --gpus all -p 8000:8000 -v /srv/vllm-cache:/root/.cache/huggingface vllm/vllm-openai:latest --model MODEL_ID --host 0.0.0.0 --port 8000
05

4. Önce `/v1/models`, sonra Chat Completions testi yapın

Model server hazır görünse bile tokenizer/chat template hatası ilk gerçek chat request’te ortaya çıkabilir. Basit smoke test’i deploy health gate’e ekleyin.

Komut
curl -s http://127.0.0.1:8000/v1/models | jq .
Komut
curl -s http://127.0.0.1:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"MODEL_ID","messages":[{"role":"user","content":"Say only READY"}],"max_tokens":8}' | jq .
06

5. Tensor parallel için NVLink/PCIe topolojisini hesaba katın

İki GPU toplam VRAM’i artırır ama her workload iki kat hızlanmaz. Collective communication ve PCIe/NVLink bandwidth ölçeklenmeyi belirler.

Komut
nvidia-smi topo -m
Komut
nvidia-smi nvlink --status 2>/dev/null || true
07

6. Prefix cache avantajını gerçek prompt tekrar oranıyla ölçün

Aynı uzun system prompt/RAG prefix’i tekrar eden workload cache’ten daha çok yararlanabilir. Rastgele prompt benchmark’ı bu faydayı göstermeyebilir.

Cold request TTFT ölçün.
Aynı prefix ile warm request TTFT ölçün.
Cache hit ratio ve VRAM etkisini kaydedin.
08

7. Concurrency merdiveniyle saturation noktasını bulun

1, 2, 4, 8, 16 eşzamanlı request seviyelerinde TTFT, output tok/s, p95 latency ve error rate ölçün. “En yüksek tok/s” değil SLA’nızı koruyan maksimum concurrency önemlidir.

ConcurrencyTTFT p95Output tok/sError %
1
2
4
8
16
EKA SUNUCU · TECHNICAL

GPU’yu model boyutuna değil concurrency SLA’sına göre seçin

Eka Sunucu GPU altyapısında vLLM için model, context ve eşzamanlı request hedefinize göre tek/çoklu GPU benchmark ortamı planlayabilirsiniz.

Production ilkesiÖlç → Test Et → Canlıya AlUydurma benchmark verisi kullanılmaz.
SRC

Resmî kaynaklar

Rehber hazırlanırken esas alınan birincil dokümantasyon ve teknik kaynaklar.

EKA

İlgili teknik içerikler

İlgili altyapı ve uygulama rehberleriyle devam edin.

FAQ

Sık sorulan sorular

vLLM API

vLLM OpenAI SDK ile çalışır mı?

OpenAI-compatible endpoint’leri sayesinde birçok SDK/uygulama base URL ve model adı değiştirilerek bağlanabilir; kullanılan endpoint özelliğini ayrıca doğrulayın.

vLLM için model VRAM’e sığarsa yeterli mi?

Hayır. KV cache, runtime ve concurrency için ek VRAM gerekir. Context ve eşzamanlı kullanıcı hedefi capacity planına eklenmelidir.

İki GPU iki kat hızlı mıdır?

Garanti değildir. Tensor parallel communication, model boyutu, batch ve GPU interconnect’e bağlıdır.

vLLM Docker image adı nedir?

Resmî dokümantasyon `vllm/vllm-openai` image’ini OpenAI-compatible serving için gösterir.

Top