Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
EKA SUNUCU · DERİN TEKNİK REHBER

Docker Model Runner Kurulumu: GPU, API, Model Yönetimi ve Ollama Karşılaştırması

Docker Model Runner: Windows/Linux GPU gereksinimleri, llama.cpp/vLLM/Diffusers, OpenAI-Ollama API, context/VRAM, OCI modelleri ve Ollama farkları.

Docker Model Runner NVIDIA / GPU OpenAI & Ollama API Son teknik kontrol: 14 Ağustos 2026
Kaynakla doğrulanan güncel bulgular
01

Docker Model Runner (DMR), modelleri Docker Hub, OCI uyumlu registry veya Hugging Face'den çekip yerel olarak servis edebiliyor.

02

Güncel Docker dokümanına göre DMR OpenAI ve Ollama uyumlu API'ler sunuyor; ayrıca Anthropic uyumlu endpoint'ler de API referansında belgeleniyor.

03

Inference backend'leri llama.cpp, vLLM ve Diffusers; vLLM ve Diffusers Linux + NVIDIA tarafında konumlandırılıyor.

04

Windows amd64 için Docker güncel gereksinimde NVIDIA GPU ve 576.57+ driver belirtiyor.

01

Bu sayfaya hangi durumda gelinir?

Ollama yerine model lifecycle'ını Docker/OCI içinde yönetmek istiyorsunuz OpenAI uyumlu API ile local model bağlamak istiyorsunuz GGUF veya Safetensors modelini registry artifact olarak paketlemek istiyorsunuz Context büyüdükçe VRAM/RAM taşması yaşıyorsunuz
02

Docker Model Runner neyi çözüyor?

Ollama local model kullanımını çok basitleştirdi; Docker Model Runner ise model dağıtımını mevcut Docker/registry/Compose iş akışına yaklaştırıyor. Modeli yalnız bir klasörde tutmak yerine OCI artifact olarak version, pull/push ve deployment zincirine dahil edebilmeniz ana farklardan biri.

DMR modelleri ilk kullanımda indirip local cache'te tutar; request geldiğinde memory'ye yükler ve kullanılmadığında kaynak optimizasyonu için unload edebilir. Bu davranış sunucu kapasite planında cold load süresi ile resident VRAM'i ayırmayı gerektirir.

03

Windows ve Linux gereksinimlerini karıştırmayın

Docker Desktop Windows amd64 tarafında güncel doküman NVIDIA GPU ve driver 576.57+ şartını listeliyor. Docker Engine Linux tarafında CPU, NVIDIA CUDA, AMD ROCm ve Vulkan backend seçenekleri daha geniştir; dolayısıyla 'DMR AMD'de çalışır' cümlesi işletim sistemi belirtilmeden eksik kalır.

vLLM ve Diffusers backend'leri güncel DMR dokümanında Linux + NVIDIA GPU ile sınırlı konumlandırılıyor. Windows'ta llama.cpp tabanlı GGUF local LLM kullanımı daha doğal başlangıç noktasıdır.

Komut / kontrol
nvidia-smi
docker version
04

İlk model: pull, run ve inspect akışı

DMR CLI model lifecycle için `docker model` komutlarını kullanır. Modeli registry'den pull edip çalıştırabilir, inspect ile metadata/context capability'yi görebilir ve uygulamanızı aynı host üzerindeki API'ye bağlayabilirsiniz.

`docker model` tanınmıyorsa Docker Desktop/Engine sürümü ve Model Runner'ın enable durumu kontrol edilmelidir. Eski Docker sürümünde internetten farklı CLI plugin kopyalamak yerine önce resmi güncelleme yolunu izleyin.

Komut / kontrol
docker model --help
docker model pull ai/qwen2.5-coder
docker model inspect ai/qwen2.5-coder
05

OpenAI, Anthropic ve Ollama uyumlu API ne kazandırıyor?

Docker Desktop'ta host TCP erişimi etkinleştirildiğinde DMR API varsayılan örneklerde localhost:12434 üzerinden erişilebilir. OpenAI client'ları `/engines/v1` base URL, Ollama uyumlu client'lar aynı host endpoint'ini kullanabilir. Böylece mevcut SDK ve araçları local modele taşıma maliyeti düşer.

API uyumluluğu 'tüm Ollama/OpenAI özellikleri birebir aynıdır' anlamına gelmez. Tool calling, embeddings, model options ve streaming ihtiyacını kullanacağınız client özelinde test edin.

Komut / kontrol
curl http://localhost:12434/engines/v1/models
curl http://localhost:12434/api/tags
06

Context size büyüdükçe VRAM/RAM neden artıyor?

Model weights aynı kalsa bile uzun context KV cache ve runtime buffer tüketimini büyütür. Docker `docker model configure --context-size` ile gerçek inference context'ini düşürüp artırmayı destekler. Out-of-memory hatasında ilk çözümlerden biri context'i küçültmektir.

Docker dokümanı model inspect'in maksimum supported context ile configured context'i aynı şey olarak göstermediğine dikkat çekiyor. 'Model 128K destekliyor' demek 128K'yı mevcut 8/12/16 GB VRAM'de pratik çalıştırabileceğiniz anlamına gelmez.

Komut / kontrol
docker model configure --context-size 8192 ai/qwen2.5-coder
docker model inspect ai/qwen2.5-coder
07

llama.cpp, vLLM ve Diffusers hangi iş için?

llama.cpp quantized GGUF modelleriyle local geliştirme ve kaynak verimliliği için uygundur. vLLM Safetensors tabanlı yüksek throughput serving'e yönelir. Diffusers ise Stable Diffusion sınıfı text-to-image modellerini servis etmek için kullanılır.

Bu yüzden DMR yalnız 'Ollama alternatifi LLM runner' olarak değerlendirilmemeli; aynı ürün altında farklı inference engine ve model artifact iş akışları sunması asıl stratejik farkıdır.

08

Docker Model Runner mı Ollama mı?

Ollama hızlı kurulum, geniş topluluk, Modelfile ve basit local API deneyiminde hâlâ çok pratiktir. DMR ise Docker kullanan ekiplerde registry, Compose, artifact distribution, container uygulamalarla discovery ve standard deployment akışında avantaj sağlar.

Tek kişilik Windows workstation'da yalnız chat/coding modeli çalıştıracaksanız Ollama daha az kavramla başlayabilir. Aynı modeli uygulama stack'iyle versionlayıp registry'de paylaşacak, Linux GPU server'a taşıyacak veya Diffusers/vLLM kullanacaksanız DMR daha doğal olabilir.

09

Güvenlik ve izolasyon davranışı platforma göre farklı

Docker dokümanına göre Linux'ta DMR inference engine'leri container isolation boundary içinde çalışır. macOS ve Windows'ta engine'ler klasik container içinde değil, platform sandbox mekanizmalarıyla izole edilir. Bu ayrım güvenlik mimarisi değerlendirirken önemlidir.

Model artifact'ı da yazılım bağımlılığı gibi supply-chain girdisidir. Registry provenance, model kaynağı, lisans ve custom runtime flags production'a alınmadan incelenmelidir.

Teşhis tablosu

DMR ve Ollama karar tablosu

İhtiyaç Daha doğal seçenek
Hızlı tek kullanıcı local chat/coding Ollama
Docker Compose/registry ile model lifecycle Docker Model Runner
Linux yüksek throughput Safetensors DMR + vLLM
Docker içinde image generation DMR + Diffusers (Linux/NVIDIA)
Risk ve uygulama notu

Komutları üretim sistemine uygulamadan önce bağlamı doğrulayın, yedek ve geri dönüş planı oluşturun. DNS, TLS, recovery, Docker veya WordPress ayarlarında birden fazla değişkeni aynı anda değiştirmek kök nedeni görünmez hale getirir.

FAQ

Sık sorulan sorular

Docker Model Runner Ollama'nın yerini tamamen alır mı?

Hayır. İki araç örtüşen local inference ihtiyaçlarını farklı ekosistem ve deployment öncelikleriyle çözüyor.

Windows'ta AMD GPU ile DMR çalışır mı?

Güncel Docker Desktop Windows amd64 gereksinimi NVIDIA GPU listeliyor; AMD/ROCm desteği Docker Engine Linux tarafında belgeleniyor.

Context size yükseltmek kaliteyi her zaman artırır mı?

Hayır. Daha büyük context daha fazla memory tüketir ve gereksiz uzun context throughput'u düşürebilir. İhtiyaca göre en küçük yeterli context daha sağlıklıdır.

REFERANS

Resmî ve birincil teknik kaynaklar

CLUSTER

İlgili teknik rehberler

EKA SUNUCU · ALTYAPI VE TEKNİK DESTEK

Local AI için GPU VPS veya fiziksel GPU sunucu seçin

Sorun hosting, VPS, Docker, Cloudflare, Windows veya WordPress altyapınızda devam ediyorsa hata çıktısı ve mevcut mimariyle birlikte teknik destek kaydı oluşturabilirsiniz.

Top