Evet, Ollama GPU olmadan da çalışabilir. Ollama'nın güncel Docker dokümantasyonu doğrudan CPU-only container komutu yayınlıyor. Bizim gerçek Ubuntu 24.04 VPS testimizde compute GPU passthrough yoktu; qwen3:4b tamamen CPU üzerinde yüklendi, ollama ps 100% CPU ve context 4096 gösterdi, container yaklaşık 3.059 GiB RAM kullandı ve gerçek /api/chat isteği yaklaşık 18 saniyede EKA-OLLAMA-TEST-BASARILI cevabını verdi. Bu değerler yalnız bizim test anımıza aittir, benchmark garantisi değildir.
Ubuntu 24.04 VPS
GPU passthrough: yok
↓
Ollama Docker CPU-only
↓
qwen3:4b ~2.5 GB
↓
ollama ps: 100% CPU / context 4096
Docker RAM: ~3.059 GiB
/api/chat: ~18 sn gerçek testOllama'nın güncel Docker dokümantasyonu CPU-only başlığı altında standart ollama/ollama image ile GPU flag'i olmadan container çalıştırmayı gösteriyor. Bu nedenle GPU Ollama için zorunlu başlangıç şartı değildir.
GPU özellikle büyük modeller ve yüksek throughput için ciddi hız avantajı sağlayabilir; 'çalışır' ile 'hızlı çalışır' aynı şey değildir.
docker run -d -v ollama:/root/.ollama --name ollama ollama/ollamaGerçek sunucu AMD Ryzen 9 7950X tabanlı 8 vCPU ve yaklaşık 31 GiB RAM sunuyordu, fakat AI compute GPU cihaza aktarılmamıştı. Ollama bu nedenle CPU modunda çalıştı.
Bu donanım bağlamı sonuçları yorumlamak için önemlidir; farklı CPU, vCPU limiti ve host contention süreleri ciddi değiştirir.
Gerçek ollama list çıktısında qwen3:4b yaklaşık 2.5 GB görünüyordu. Metadata 4.0B parameter_size ve Q4_K_M quantization raporladı.
Diskteki model boyutu ile inference sırasında RAM'de yüklü model boyutu aynı değildir.
docker exec ollama ollama listGerçek test anında ollama ps PROCESSOR sütunu 100% CPU gösterdi ve context değeri 4096 idi. Ollama'nın güncel FAQ'sı da PROCESSOR sütununun 100% CPU durumunu modelin sistem belleğine tamamen yüklendiği şeklinde açıklar.
Bu kontrol GPU algılandı mı sorusuna tahminden daha net cevap verir.
docker exec ollama ollama psdocker stats snapshotımız inference sonrası Ollama containerı için yaklaşık 3.059 GiB kullanım gösterdi. ollama ps model size tarafında yaklaşık 3.2 GB loaded size gösteriyordu.
Prompt context, parallel requests ve model versiyonu RAM kullanımını artırabilir; 3.059 GiB'yi minimum sistem gereksinimi gibi yorumlamayın.
docker stats --no-stream ollamaGerçek non-streaming API testinde modelden yalnız EKA-OLLAMA-TEST-BASARILI yazması istendi ve total_duration yaklaşık 18.4 saniye civarındaydı. Bu, ilk/model-loaded durum, CPU scheduling ve test anı koşullarını içerir.
Tek bir prompt sonucunu genel tokens/s benchmarkı gibi sunmuyoruz; yalnız gerçek test latency'sini belgeliyoruz.
curl -sS http://127.0.0.1:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3:4b","messages":[{"role":"user","content":"Sadece EKA-OLLAMA-TEST-BASARILI yaz."}],"stream":false}'Gerçek ekranlarda qwen3:4b Open WebUI model seçicide ve n8n Ollama Qwen3 4B node'unda çalışıyor. Calculator tool testi de Agent'ın CPU-backed modelle tool çağırabildiğini gösterdi.
Bu ekranlar performance sayısı vermese de CPU-only backendin gerçek uygulama entegrasyonlarında kullanılabildiğini kanıtlar.



4B sınıfı quantized model düşük/orta trafik ve deneysel workflowlarda CPU ile kullanılabilir; ancak daha büyük modeller, uzun context, düşük latency veya çoklu eşzamanlı kullanıcı talepleri arttıkça GPU avantajı büyür.
Kapasite planını yalnız model disk boyutuna göre değil gerçek RAM, latency ve concurrency testine göre yapın.
Evet; resmî Docker docs CPU-only çalıştırmayı destekliyor ve bizim gerçek testimiz de çalıştı.
qwen3:4b.
Gerçek listede yaklaşık 2.5 GB.
Test anında container yaklaşık 3.059 GiB kullanıyordu.
100% CPU.
ollama ps testinde 4096.
Yaklaşık 18 saniye; tek test anına ait değer.
Hayır; gerçek kurulum latency ve kaynak snapshotıdır.
LLM matris işlemlerini yüksek paralellikle hızlandırabilir.
Kullanım hedefi ve latency beklentisine göre uygun olabilir; gerçek test yapın.
Yüklü çalışan model, processor dağılımı ve context gibi bilgileri gösterir.
Ollama FAQ'ına göre model tamamen sistem belleğinde/CPU tarafında yüklüdür.
Evet; gerçek ekranımızda qwen3:4b seçiliydi.
Evet; gerçek n8n ekranlarında Ollama Qwen3 4B ve Calculator tool başarıyla çalıştı.
Yerel LLM ve Ollama servisleri için EKA Sunucu Linux VPS kaynaklarını inceleyebilirsiniz.
Güncellendi: 10.08.2026