SGLang ist für Production-LLM-Serving ausgelegt und bietet OpenAI-kompatible APIs von Single-GPU bis Distributed Cluster. Neben Token/s sollten TTFT, TPOT und Concurrency gemessen werden.
Offizielle SGLang-Args nutzen `--tp` für Tensor Parallel und `--dp` für Data Parallel. Für DP wird Model Gateway empfohlen. `bench_serving` misst TTFT, TPOT, ITL und Throughput.
Model Gateway kann Traffic über Replicas/DP-Server routen; GPU-Server führen das Modell gemäß TP/DP-Topologie aus.
First-Token-Latenz, Inter-Token-Verhalten und Throughput unter Concurrency gemeinsam bewerten.
TP wenn Modell nicht in eine GPU passt. Passt es, aber Throughput reicht nicht, kann DP besser sein. TP+DP kann kombiniert werden.
Modellname und Concurrency an eigenen Workload anpassen.
python -m sglang.launch_server --model-path Qwen/Qwen3-8B --host 127.0.0.1 --port 30000python -m sglang.bench_serving --backend sglang --base-url http://127.0.0.1:30000 --num-prompts 100nvidia-smiss -lntp | grep ':30000'Auth, Rate Limits, Quotas, TLS und Tenant Policies zentral im Gateway/Reverse Proxy halten.
Ja.
TP teilt ein Modell über GPUs; DP repliziert Instanzen für mehr Throughput.
Es bestimmt die gefühlte erste Reaktion; hoher Throughput kann trotzdem träge wirken.
Teilen Sie Modell, GPUs, Context, Peak Concurrency und Latenzziel; TP/DP und Gateway planen.