Ollama tek kullanıcı local kullanımın ötesinde API serving yapabilir; production kapasitesinde modelin VRAM'e sığması, context uzunluğu, paralel request, aynı anda yüklü model sayısı ve queue sınırı kritik hale gelir. Bunlar birbirinden bağımsız değildir.
Ollama FAQ'ya göre `OLLAMA_NUM_PARALLEL` arttıkça model için efektif context kapasitesi paralel request sayısıyla ölçeklenir ve RAM/VRAM ihtiyacı yükselir. `OLLAMA_MAX_LOADED_MODELS` aynı anda kaç modelin bellekte tutulacağını, `OLLAMA_MAX_QUEUE` ise yoğunlukta kaç isteğin kuyrukta bekleyebileceğini kontrol eder.
İstek geldiğinde Ollama modeli yükler veya mevcut resident modeli kullanır. Bellek yetersizse başka model unload edilebilir veya istek queue'ya alınabilir.
Ayarları artırmak otomatik performans kazancı değildir; VRAM sınırı aşıldığında queue veya unload/reload maliyeti oluşabilir.
Ollama'nın güncel context dokümanı daha uzun context'in daha fazla memory gerektirdiğini açıkça belirtir. Agent/coding gibi uzun context işlerinde VRAM planı buna göre büyütülmelidir.
Public API yerine localhost/private network üzerinden test edin.
ollama psollama listcurl -s http://127.0.0.1:11434/api/tagsnvidia-smijournalctl -u ollama --since '-15 min' --no-pagerLocal Ollama API için TLS/auth katmanını reverse proxy, VPN veya private network ile sağlayın. Model download/upgrade ve volume backup süreçlerini de ayrı yönetin.
`OLLAMA_NUM_PARALLEL` ve available memory'e göre değişir; varsayılan ve runtime davranışı sürüme/donanıma göre kontrol edilmelidir.
FAQ'ya göre queue kapasitesi aşıldığında server overloaded 503 yanıtı verebilir.
Evet. `/api/embed` ve OpenAI uyumlu embedding kullanım senaryoları desteklenir.
Model adı, context, aynı anda kullanıcı/request ve keep-alive beklentisini iletin; VRAM/RAM ve queue ayarlarını planlayalım.