vLLM, online serving için OpenAI-compatible API server ve yüksek throughput odaklı inference altyapısı sunar. Production boyutlandırma yalnız model ağırlığını VRAM'e sığdırmak değildir; KV cache, context, eş zamanlı istek, tensor/data parallel ve API server CPU yükü birlikte ölçülmelidir.
Güncel vLLM dokümantasyonu `vllm serve` ile OpenAI-compatible Completions, Chat ve diğer API'lerin sunulabildiğini belirtir. Resmî doküman ayrıca `--api-key` seçeneğinin yalnız belirli path prefix'lerini koruduğunu, aynı HTTP server üzerindeki her endpoint'i otomatik korumadığını açıkça uyarır; production'da reverse proxy/firewall katmanı ayrıca gereklidir.
vLLM V1 mimarisinde API server input işlemlerini ve streaming'i yönetir; engine core scheduler/KV cache işlerini koordine eder; GPU worker süreçleri model forward pass'lerini çalıştırır.
Tensor parallel tek modelin ağırlık/hesabını GPU'lar arasında böler. Data parallel model kopyalarını ayrı GPU/rank üzerinde çoğaltıp bağımsız request batch'leri işler.
Resmî güvenlik notu her endpoint'in API key ile korunmadığını açıkça belirtir. API'yi private network veya reverse proxy arkasında yayınlayın; TLS, rate limit ve auth'u merkezi katmanda uygulayın.
Model adını kendi deployment'ınıza göre değiştirin.
nvidia-smicurl -s http://127.0.0.1:8000/v1/modelscurl -s http://127.0.0.1:8000/healthps aux | grep '[v]llm'ss -lntp | grep ':8000'KV cache, context, batch/concurrency, multimodal input ve runtime overhead VRAM kullanımını artırabilir. Gerçek trafik profiliyle benchmark yapmadan yalnız model dosya boyutuna göre GPU seçmeyin.
Evet. OpenAI-compatible server sayesinde base URL değiştirilerek birçok OpenAI istemcisiyle kullanılabilir.
Hayır. Resmî doküman built-in API key'in tüm endpointleri korumadığını belirtir; reverse proxy/firewall/auth katmanı eklenmelidir.
Model tek GPU VRAM'ine sığmadığında veya çok GPU üzerinde model hesaplamasını bölmek gerektiğinde kullanılır.
Model adı, precision/quantization, context, eş zamanlı istek ve hedef token/s bilgisini iletin; GPU/VRAM ve TP/DP planını çıkaralım.