Ja, Ollama kann ohne GPU laufen. Die aktuelle Ollama-Docker-Dokumentation enthält einen CPU-only-Weg. Im realen Ubuntu-24.04-VPS-Test gab es kein Compute-GPU-Passthrough: qwen3:4b wurde vollständig auf CPU geladen, ollama ps zeigte 100% CPU und Context 4096, der Container nutzte etwa 3.059 GiB RAM und ein echter /api/chat-Aufruf lieferte EKA-OLLAMA-TEST-BASARILI in ungefähr 18 Sekunden. Diese Werte sind keine allgemeine Benchmark-Garantie.
Ubuntu 24.04 VPS
GPU passthrough: keines
↓
Ollama Docker CPU-only
↓
qwen3:4b ~2.5 GB
↓
ollama ps: 100% CPU / Context 4096
Docker RAM: ~3.059 GiB
/api/chat: ~18 s realer TestDie aktuelle Ollama-Docker-Dokumentation zeigt ausdrücklich CPU-only ohne GPU-Flags. Eine GPU ist also keine zwingende Startvoraussetzung.
GPU kann bei größeren Modellen deutlich beschleunigen.
docker run -d -v ollama:/root/.ollama --name ollama ollama/ollamaDer reale Server bot 8 vCPU von einem Ryzen-9-7950X-Host und etwa 31 GiB RAM, aber kein Compute-GPU-Passthrough.
Andere CPUs und vCPU-Limits ändern die Latenz deutlich.
Die reale ollama-list-Ausgabe zeigte qwen3:4b mit ca. 2,5 GB, 4.0B Parameter und Q4_K_M.
Dateigröße und Laufzeit-RAM sind nicht identisch.
docker exec ollama ollama listIm realen Test zeigte ollama ps 100% CPU und Context 4096. Laut aktueller Ollama-FAQ bedeutet 100% CPU vollständiges Laden in System-RAM.
Damit lässt sich GPU-Nutzung direkt prüfen.
docker exec ollama ollama psDocker stats zeigte nach Inferenz etwa 3.059 GiB; ollama ps ungefähr 3.2 GB geladene Modellgröße.
Context und Parallelität können RAM-Bedarf ändern.
docker stats --no-stream ollamaEine echte Non-Streaming-Anfrage mit nur EKA-OLLAMA-TEST-BASARILI dauerte im Test ungefähr 18,4 Sekunden.
Das ist eine reale Latenz, kein allgemeiner Benchmark.
curl -sS http://127.0.0.1:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3:4b","messages":[{"role":"user","content":"Sadece EKA-OLLAMA-TEST-BASARILI yaz."}],"stream":false}'Reale Screens zeigen qwen3:4b in Open WebUI und im n8n-Ollama-Node. Calculator bestätigt Tool Calling.
Damit ist echte Integration statt nur API-Test belegt.
Ein quantisiertes 4B-Modell kann für Entwicklung und leichte Lasten auf CPU brauchbar sein; größere Modelle, längere Contexts und Parallelität profitieren stärker von GPU.
Kapazität mit realen Tests planen.
Ja; offizielle Docker-Docs und unser realer Test bestätigen CPU-only.
qwen3:4b.
Etwa 2,5 GB in der realen Liste.
Etwa 3.059 GiB im Testmoment.
100% CPU.
4096 im ollama-ps-Test.
Ungefähr 18 Sekunden; einzelner Testwert.
Nein; reale Latenz-/Ressourcenaufnahme.
GPU beschleunigt hochparallele LLM-Matrixoperationen.
Kann je nach Last/Latenz passend sein; real testen.
Es zeigt geladene Modelle, Processor-Verteilung und Context.
Laut Ollama-FAQ vollständig im System-RAM/CPU.
Ja; qwen3:4b war im realen Screen ausgewählt.
Ja; reale n8n-Screens zeigen funktionierendes Ollama Qwen3 4B und Calculator.
EKA-Sunucu-Linux-VPS-Ressourcen für lokale LLM- und Ollama-Workloads auswählen.
Aktualisiert: 10.08.2026