SGLang production-level LLM serving için tasarlanmış inference framework'üdür. Tek GPU'dan distributed cluster'a kadar OpenAI-compatible API sunabilir. Kapasite planında yalnız token/s değil time-to-first-token, time-per-output-token ve eş zamanlı istek davranışı ölçülmelidir.
Resmî SGLang sunucu argümanlarında tensor parallel için `--tp`, data parallel için `--dp` seçenekleri bulunur. Dokümantasyon data parallel için SGLang Model Gateway kullanımını önerir. Production benchmark tarafında `bench_serving` gerçek HTTP serving metrikleri olan TTFT, TPOT, ITL ve throughput'u ölçer.
Model Gateway çoklu replica veya data-parallel server'lar önünde routing katmanı olabilir; GPU server'lar TP/DP topolojisine göre modeli çalıştırır.
İlk token gecikmesi, tokenlar arası süre ve concurrency altında throughput birlikte değerlendirilmelidir.
Model bir GPU'ya sığmıyorsa TP gerekir. Model tek GPU'ya sığıyor ama throughput yetersizse DP daha uygun olabilir. Aynı anda TP+DP de kullanılabilir.
Model adını ve concurrency değerini kendi workload'unuza göre değiştirin.
python -m sglang.launch_server --model-path Qwen/Qwen3-8B --host 127.0.0.1 --port 30000python -m sglang.bench_serving --backend sglang --base-url http://127.0.0.1:30000 --num-prompts 100nvidia-smiss -lntp | grep ':30000'Auth, rate limit, usage quota, TLS ve tenant politikalarını ayrı gateway/reverse proxy katmanında merkezi tutmak daha kontrollüdür.
Evet. Resmî dokümantasyon OpenAI-compatible API ile model serving'i destekler.
TP tek model hesabını GPU'lara böler; DP model instance'larını çoğaltıp throughput'u artırır.
Chat veya agent kullanımında kullanıcı ilk yanıtı TTFT süresinden hisseder; toplam token/s iyi olsa bile yüksek TTFT kötü deneyim yaratabilir.
Model, GPU sayısı, context, peak concurrency ve latency hedefini iletin; TP/DP ve gateway topolojisini belirleyelim.