Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
Ubuntu 24.04 Ollama + Qwen3 4B: Lokale KI mit Docker installieren
Ollama, Qwen3, Docker und Ubuntu 24.04

Ollama + Qwen3 4B unter Ubuntu 24.04 mit Docker installieren

In diesem realen Ubuntu-24.04.4-LTS-VPS-Test lief Ollama in Docker, qwen3:4b wurde mit ungefähr 2,5 GB geladen, ein echter /api/chat-Inferenztest durchgeführt und die Ollama-API nur an 127.0.0.1:11434 gebunden.

Ubuntu 24.04OllamaQwen3qwen3:4bDockerLokale KISelf Hosted AILLMLinux VPSCPU InferenzEKA Sunucu
Ollama / Qwen3 / Open WebUI / Ubuntu 24.04
Ubuntu 24.04.4 LTS
   ↓ Docker / eka-ai
Ollama :11434
   ↓
qwen3:4b
   ↓
Echter /api/chat Test
   ↓
127.0.0.1 lokale API
Ollama0.32.6Open WebUI0.11.0 test
13echte WebP-Screenshots
3TR · EN · DE Inhalt
443öffentliches HTTPS
127.0.0.1KI-Dienste Loopback
01Ollama mit Docker
02qwen3:4b Modell
03Echter API-Inferenztest
04localhost-Port-Sicherheit
00
Inhaltsverzeichnis

Installationsschritte für Ollama + Qwen3 4B unter Ubuntu 24.04

  1. 01Was bauen wir mit Ollama und Qwen3 4B unter Ubuntu 24.04?
  2. 02CPU, RAM, Datenträger und GPU vor der Installation prüfen
  3. 03Docker Engine und Compose prüfen
  4. 04Docker-Netzwerk eka-ai und Volume ollama_data erstellen
  5. 05Ollama nur auf localhost Port 11434 starten
  6. 06qwen3:4b herunterladen und Ollama-Modellliste prüfen
  7. 07Mit qwen3:4b einen echten Chat-Request senden
  8. 08CPU/RAM-Nutzung und localhost-Port-Sicherheit abschließend prüfen
01
Reale Testarchitektur

Was bauen wir mit Ollama und Qwen3 4B unter Ubuntu 24.04?

Diese Anleitung dokumentiert eine reale Docker-basierte Ollama-Installation unter Ubuntu 24.04.4 LTS. Ziel ist, qwen3:4b vollständig auf dem VPS auszuführen und die API nicht direkt auf öffentlichen Interfaces bereitzustellen.

Im finalen Aufbau hängt Ollama im Docker-Netzwerk eka-ai, Modelle liegen dauerhaft im Named Volume ollama_data und die Host-API ist nur über 127.0.0.1:11434 erreichbar.

Befehl 1
Ubuntu 24.04.4 LTS
   ↓
Docker / eka-ai
   ↓
Ollama :11434
   ↓
qwen3:4b
   ↓
127.0.0.1 lokale API
02
Ressourcenprüfung

CPU, RAM, Datenträger und GPU vor der Installation prüfen

Der Test-VPS lief mit Ubuntu 24.04.4 LTS, 8 vCPUs und rund 31 GiB RAM. Als Prozessor wurde eine AMD-Ryzen-9-7950X-Basis angezeigt. Weder NVIDIA-Treiber noch ein nutzbares ROCm-Compute-Gerät waren vorhanden, daher wurde der erste Aufbau im CPU-Modus verifiziert.

Lokale Modelle benötigen RAM und Speicherplatz. Planen Sie nicht nur nach Parameterzahl, sondern auch nach Quantisierung, Kontextfenster, gleichzeitigen Benutzern und Betriebssystemreserve.

Befehl 1
cat /etc/os-release | grep -E 'PRETTY_NAME|VERSION_ID|VERSION_CODENAME'
uname -r
free -h
df -h /
Befehl 2
lscpu | grep -E 'Architecture|CPU\(s\)|Model name'
nvidia-smi 2>/dev/null || true
ls -la /dev/dri 2>/dev/null || true
03
Docker-Grundlage

Docker Engine und Compose prüfen

Da Ollama und Open WebUI in Docker laufen, wurden zuerst Docker-Daemon und Compose-Plugin geprüft. Im realen Test liefen Docker Engine 29.7.2 und Docker Compose v5.4.0.

Falls Docker noch fehlt, führen Sie zuerst den Ubuntu-24.04-Docker-und-Portainer-Ratgeber mit dem offiziellen Docker-Repository aus.

Befehl 1
docker --version
docker compose version
systemctl is-active docker
04
Netzwerk und Persistenz

Docker-Netzwerk eka-ai und Volume ollama_data erstellen

Wir erstellten das Bridge-Netzwerk eka-ai, damit Open WebUI den Ollama-Container über seinen Namen auflösen kann. Das Named Volume ollama_data speichert die heruntergeladenen Modelle unabhängig vom Container-Lebenszyklus.

Container können bei Updates neu erstellt werden, während die Modelldaten im Volume erhalten bleiben. Löschen Sie das Volume nicht ohne verifiziertes Backup.

Befehl 1
docker network inspect eka-ai >/dev/null 2>&1 || docker network create eka-ai
docker volume create ollama_data
Befehl 2
docker network inspect eka-ai --format 'Netz={{.Name}} Driver={{.Driver}} Scope={{.Scope}}'
docker volume inspect ollama_data
05
Ollama im CPU-Modus

Ollama nur auf localhost Port 11434 starten

Im Test wurde kein GPU-Passthrough erkannt, daher lief das offizielle Ollama-Docker-Image im CPU-Modus. Host-Port 11434 wurde an 127.0.0.1 statt 0.0.0.0 gebunden, sodass die Ollama-API nicht direkt im Internet veröffentlicht wurde.

Der Container trat zugleich dem Netzwerk eka-ai bei. Open WebUI kann Ollama damit als ollama:11434 erreichen, ohne den privaten Dienst öffentlich zu machen.

Befehl 1
docker pull ollama/ollama:latest
Befehl 2
docker run -d --name ollama --restart unless-stopped --network eka-ai -p 127.0.0.1:11434:11434 -v ollama_data:/root/.ollama ollama/ollama:latest
Befehl 3
docker ps --filter name='^/ollama$'
curl -sS http://127.0.0.1:11434/api/tags
06
Lokales Modell

qwen3:4b herunterladen und Ollama-Modellliste prüfen

Nachdem Ollama erreichbar war, luden wir qwen3:4b in den Container. Die reale API-Ausgabe zeigte ungefähr 2,5 GB Speicherbedarf, parameter_size 4.0B und die Quantisierung Q4_K_M.

Die Downloadzeit hängt von Netzwerk und Datenträger ab. Warten Sie den Pull vollständig ab, bevor Sie das Modell in Open WebUI erwarten.

Befehl 1
docker exec ollama ollama pull qwen3:4b
Befehl 2
docker exec ollama ollama list
curl -sS http://127.0.0.1:11434/api/tags
07
API-Prüfung

Mit qwen3:4b einen echten Chat-Request senden

Ein Modell in der Liste beweist noch keine funktionierende Inferenz. Deshalb sendeten wir eine echte Anfrage an /api/chat und qwen3:4b lieferte die erwartete Testphrase zurück.

Im CPU-Test belegte Ollama bei geladenem Modell ungefähr 3 GiB RAM; ollama ps zeigte 100% CPU. Diese Werte gelten nur für den aufgenommenen Testzeitpunkt und ändern sich mit Kontext und Parallelität.

Befehl 1
curl -sS http://127.0.0.1:11434/api/chat -d '{"model":"qwen3:4b","messages":[{"role":"user","content":"Schreibe nur EKA-OLLAMA-TEST-BASARILI."}],"stream":false}'
Befehl 2
docker exec ollama ollama ps
docker stats --no-stream ollama
08
Ollama-Abschlussprüfung

CPU/RAM-Nutzung und localhost-Port-Sicherheit abschließend prüfen

Nach der echten Inferenz war qwen3:4b auf der CPU geladen und der Ollama-Container nutzte im Test ungefähr 3 GiB RAM. Der reale Verbrauch hängt von Modell, Kontext und Parallelität ab.

Der wichtigste Abschlusscheck ist, dass Port 11434 nur auf 127.0.0.1 lauscht und die Standard-Ollama-API damit nicht direkt auf öffentlichen Interfaces veröffentlicht wird.

Befehl 1
docker exec ollama ollama ps
docker stats --no-stream ollama
Befehl 2
ss -lntp | grep ':11434'
docker network inspect eka-ai --format '{{range .Containers}}Netz={{$.Name}} IP={{.IPv4Address}}{{end}}'
Production checklist

Ollama Sicherheitscheck für Produktion

Port 11434 nicht ungeschützt auf 0.0.0.0 veröffentlichen.
Host-API auf 127.0.0.1 oder in einem privaten Netz halten.
Das Volume ollama_data regelmäßig sichern.
RAM- und Datenträgerverbrauch überwachen.
Eine Docker-Restart-Policy verwenden.
Vor Image-Updates Snapshot oder Rollback-Plan erstellen.
Bei Remote-Veröffentlichung TLS und Authentifizierung hinzufügen.
Nach Reboot Container, Modellliste und API-Health erneut prüfen.
R
Offizielle Quellen

Offizielle Ollama- und Qwen3-Quellen

+
EKA Sunucu

Verwandte EKA-Sunucu-Linux- und KI-Ratgeber

?
FAQ

Häufige Fragen zu Ollama und Qwen3 4B

Läuft Ollama unter Ubuntu 24.04 mit Docker?

Ja. Im realen Test lief Ollama unter Ubuntu 24.04.4 LTS mit dem Docker-Image ollama/ollama.

Ist eine GPU für Ollama erforderlich?

Nein. Der Test-VPS hatte kein Compute-GPU-Passthrough und qwen3:4b lief im CPU-Modus.

Wie viel Speicherplatz benötigte qwen3:4b?

Die reale ollama-list-Ausgabe zeigte ungefähr 2,5 GB.

Wie viele Parameter hat qwen3:4b?

Die reale API-Metadaten meldeten parameter_size 4.0B und Q4_K_M-Quantisierung.

Welchen Port verwendet Ollama?

Der Standard-API-Port ist 11434. In diesem Setup wird er hostseitig nur an 127.0.0.1:11434 gebunden.

Sollte die Ollama-API öffentlich erreichbar sein?

Besser sind ein privates Netz, ein authentifizierter Reverse Proxy oder eine andere Zugriffskontrolle.

Wie wurde qwen3:4b heruntergeladen?

Mit docker exec ollama ollama pull qwen3:4b im laufenden Container.

Wie prüfe ich installierte Modelle?

Mit docker exec ollama ollama list oder über http://127.0.0.1:11434/api/tags.

Wie wurde die Inferenz geprüft?

Ein POST-Request an /api/chat lieferte mit qwen3:4b den erwarteten Text EKA-OLLAMA-TEST-BASARILI.

Wie viel RAM wurde im CPU-Modus genutzt?

Mit geladenem Modell nutzte der getestete Ollama-Container ungefähr 3,06 GiB RAM.

Bleiben Modelle nach einer Container-Neuerstellung erhalten?

Ja, solange das Named Volume ollama_data erhalten bleibt.

Wie erreicht ein anderer Docker-Container Ollama?

Beide Container in dasselbe benutzerdefinierte Netzwerk hängen und http://ollama:11434 verwenden.

Kann ich ein größeres Qwen3-Modell verwenden?

Ja, wenn genügend RAM, Datenträger und idealerweise eine geeignete GPU vorhanden sind.

Was sollte vor Produktion geprüft werden?

Port-Bindings, Volume-Backups, Restart-Policy, Ressourcenverbrauch und API-Zugriffsregeln.

EKA YAZILIM VE BİLİŞİM SİSTEMLERİ

Linux VPS für Ollama und lokale KI gesucht?

Qwen3, Ollama, Open WebUI, n8n und weitere Self-Hosted-AI-Dienste auf einem eigenen EKA-Sunucu-Linux-VPS betreiben.

Aktualisiert: 10.08.2026
Linux-VPS-Pakete ansehenLinux- & VPS-Ratgeber
Top