llama.cpp C/C++ tabanlı hafif inference runtime'ıdır ve GGUF quantized modelleri CPU, GPU veya hibrit offload ile çalıştırabilir. Güncel `llama-server` OpenAI-compatible chat/responses/embeddings yolları, reranking endpoint'i, parallel decoding ve monitoring özellikleri sunar.
Hayır. Proje NVIDIA CUDA, AMD HIP, Metal, Vulkan, SYCL ve başka backend'leri destekler; modelin bir bölümünü GPU'ya offload edip kalanını CPU/RAM tarafında çalıştırmak da mümkündür. Bu esneklik düşük maliyetli veya heterojen donanımda avantaj sağlar fakat tam GPU serving'e göre latency düşebilir.
HTTP server OpenAI-compatible request'i alır; slot/continuous batching scheduler context'i yönetir; GGUF model layer'ları seçilen backend'e göre CPU ve/veya GPU üzerinde çalışır.
Quantization ve geniş backend desteği sayesinde küçük CPU VPS'ten Apple Silicon veya NVIDIA/AMD GPU hostlarına kadar çalışabilir.
Aynı runtime chat, embedding ve rerank endpoint'lerini desteklese de production'da farklı model ve latency profilleri için ayrı instance kullanmak daha kontrollüdür.
Model repo/adını kendi GGUF modelinize göre değiştirin.
llama-server -hf ggml-org/Qwen3.5-0.8B-GGUF --host 127.0.0.1 --port 8080curl -s http://127.0.0.1:8080/v1/models | headcurl -s http://127.0.0.1:8080/health | headps aux | grep '[l]lama-server'ss -lntp | grep ':8080'Built-in API key temel auth sağlar; internet-facing production'da TLS, rate limit, request body sınırı, access log ve tenant quota gibi ek kontroller gerekir.
Evet. Güncel llama-server dokümantasyonu OpenAI-compatible chat completions, responses ve embeddings route'larını listeler.
Evet. Güncel server dokümantasyonunda reranking endpoint'i ve dedicated reranking modu bulunur.
Daha agresif quantization memory ihtiyacını azaltabilir ancak model/task'a göre kalite kaybı oluşturabilir; benchmark ve kalite testi yapılmalıdır.
GGUF model, quantization, context, CPU/RAM, GPU/VRAM ve hedef kullanıcı sayısını iletin; full GPU veya hybrid planı çıkaralım.