Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
Ubuntu 24.04 Ollama API: curl /api/tags und /api/chat Anleitung
Ollama API, qwen3:4b, curl und Ubuntu 24.04

Ollama API unter Ubuntu 24.04: curl /api/tags, /api/chat und qwen3:4b Testanleitung

Diese Anleitung behandelt ausschließlich die API-Schicht unseres realen Ubuntu-24.04.4-LTS- und Docker-Setups mit Ollama qwen3:4b. /api/tags prüft Runtime und Modellliste, /api/chat führt eine echte qwen3:4b-Inferenz per curl aus. Auf dem Host verwenden wir 127.0.0.1:11434, in Docker http://ollama:11434 und prüfen zusätzlich CPU/RAM sowie das nur lokal gebundene Port-11434-Setup.

Ubuntu 24.04Ollama APIOllama curlapi/tagsapi/chatqwen3:4bQwen3Local LLM APIDockerSelf Hosted AI11434Linux VPSEKA Sunucu
Ollama / Qwen3 / Open WebUI / Ubuntu 24.04
Host → 127.0.0.1:11434
   ├── GET /api/tags → Modellliste
   └── POST /api/chat → qwen3:4b Inferenz

Docker eka-ai
   └── http://ollama:11434
Ollama0.32.6Open WebUI0.11.0 test
13echte WebP-Screenshots
3TR · EN · DE Inhalt
443öffentliches HTTPS
127.0.0.1KI-Dienste Loopback
01/api/tags Modellliste
02/api/chat echte Inferenz
03Host- + Docker-API-Adressen
04Port 11434 nur localhost
00
Inhaltsverzeichnis

Schritte zur Ollama-API-Nutzung unter Ubuntu 24.04

  1. 01Wie wird die Ollama-API vom Host und aus Docker-Containern angesprochen?
  2. 02Ollama-Runtime und HTTP-Zugriff mit /api/tags prüfen
  3. 03qwen3:4b laden und mit der Ollama-CLI prüfen
  4. 04qwen3:4b mit /api/tags als JSON verifizieren
  5. 05Mit curl eine echte qwen3:4b-Anfrage an /api/chat senden
  6. 06model, assistant content und done im Chat-JSON prüfen
  7. 07Ressourcen nach Inferenz mit ollama ps und Docker stats überwachen
  8. 08Aus n8n und Open WebUI http://ollama:11434 verwenden
  9. 09Port 11434 nur auf localhost halten und Public-Binding prüfen
  10. 10Connection refused, leere Modellliste und langsame CPU-Inferenz unterscheiden
  11. 11Wichtige Ollama-API-curl- und Prüfkommandos an einem Ort sammeln
  12. 12Modell-, Volume-, Log- und API-Health-Prüfungen zur Routine machen
01
API-Architektur

Wie wird die Ollama-API vom Host und aus Docker-Containern angesprochen?

Diese Anleitung konzentriert sich auf die HTTP-API des bereits funktionierenden Ollama- und qwen3:4b-Stacks. Host-Anwendungen verwenden http://127.0.0.1:11434, Dienste im gemeinsamen Docker-Netzwerk eka-ai können http://ollama:11434 verwenden.

localhost in einem Container bezeichnet den Container selbst. Separate n8n- oder Open-WebUI-Container erreichen Ollama deshalb über den Docker-DNS-Namen ollama, während der Host-Port nur an Loopback gebunden bleibt.

Befehl 1
Host API:   http://127.0.0.1:11434
Docker API: http://ollama:11434
02
Erster API-Test

Ollama-Runtime und HTTP-Zugriff mit /api/tags prüfen

Vor dem Modelldownload lieferte die reale /api/tags-Anfrage HTTP 200 mit einem leeren models-Array. Damit war die HTTP-Runtime gesund, obwohl noch kein Modell installiert war.

Beim Troubleshooting diesen Test vor Modellproblemen ausführen. Antwortet der Endpunkt nicht, zuerst Container, Port-Binding und Ollama-Logs prüfen.

Befehl 1
curl -sS -w "\nHTTP %{http_code}\n" http://127.0.0.1:11434/api/tags
Befehl 2
docker logs --tail 80 ollama
03
Modellvorbereitung

qwen3:4b laden und mit der Ollama-CLI prüfen

Nach erfolgreichem API-Test wurde qwen3:4b im Container geladen. Die reale Modellliste zeigte ungefähr 2,5 GB.

Die aufgezeichneten API-Metadaten meldeten parameter_size 4.0B, Q4_K_M-Quantisierung sowie completion-, tools- und thinking-Fähigkeiten.

Befehl 1
docker exec ollama ollama pull qwen3:4b
Befehl 2
docker exec ollama ollama list
04
JSON-Modellliste

qwen3:4b mit /api/tags als JSON verifizieren

Die CLI-Liste ist für Menschen praktisch, /api/tags liefert dagegen eine JSON-Modellliste für Integrationen. Im realen Test erschien qwen3:4b dort mit Name, Größe und Modelldetails.

Wenn Open WebUI oder n8n keine Modelle sieht, denselben Endpunkt vom Host und bei Bedarf aus dem jeweiligen Container aufrufen, um Ollama- von Docker-Netzwerkproblemen zu trennen.

Befehl 1
curl -sS http://127.0.0.1:11434/api/tags
Befehl 2
docker exec ollama ollama list
05
Echte Inferenz

Mit curl eine echte qwen3:4b-Anfrage an /api/chat senden

Ein Modell in der Liste beweist noch keine funktionierende Inferenz. Deshalb wurde eine echte Benutzeranfrage an /api/chat gesendet und mit stream:false eine einzelne JSON-Antwort angefordert.

Der reale assistant-Inhalt lautete EKA-OLLAMA-TEST-BASARILI und die Anfrage endete mit done:true. Der CPU-Test dauerte ungefähr 18 Sekunden.

Befehl 1
curl -sS http://127.0.0.1:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3:4b","messages":[{"role":"user","content":"Schreibe nur EKA-OLLAMA-TEST-BASARILI."}],"stream":false}'
06
Antwort lesen

model, assistant content und done im Chat-JSON prüfen

Für den End-to-End-Test wurden model=qwen3:4b, message.role=assistant, der erwartete message.content und done:true kontrolliert.

Die aufgezeichnete Qwen3-Antwort enthielt auch ein thinking-Feld. Wenn die Anwendung nur die sichtbare Benutzerantwort benötigt, ist message.content das sauberere Ausgabefeld.

Befehl 1
Wichtige Felder:
model
message.role
message.content
done
done_reason
total_duration
07
Laufendes Modell

Ressourcen nach Inferenz mit ollama ps und Docker stats überwachen

Nach der echten Chat-Anfrage zeigte ollama ps qwen3:4b auf der CPU geladen. Zum aufgenommenen Zeitpunkt waren Context 4096 und Processor 100% CPU sichtbar.

Docker stats zeigte ungefähr 3.059 GiB für den Ollama-Container. Diese Werte beschreiben nur den Testmoment und variieren mit Prompt, Kontext, Modell und Parallelität.

Befehl 1
docker exec ollama ollama ps
Befehl 2
docker stats --no-stream ollama
08
Container-Integration

Aus n8n und Open WebUI http://ollama:11434 verwenden

127.0.0.1 ist auf dem Host korrekt, localhost in einem anderen Container zeigt aber nicht auf Ollama. Im gemeinsamen benutzerdefinierten Netzwerk löst Docker den Hostnamen ollama auf.

Unsere finale Testzusammenfassung bestätigte http://127.0.0.1:11434 für den Host und http://ollama:11434 innerhalb von Docker. Dieses Muster wurde später für Open WebUI und n8n verwendet.

Befehl 1
docker network inspect eka-ai
Befehl 2
docker exec n8n node -e "fetch('http://ollama:11434/api/tags').then(r=>r.text()).then(console.log)"
09
API-Sicherheit

Port 11434 nur auf localhost halten und Public-Binding prüfen

Die reale Bereitstellung veröffentlichte Ollama nicht direkt im Internet, sondern verwendete 127.0.0.1:11434:11434. Die ss-Ausgabe bestätigte das Loopback-Binding.

Für entfernten Zugriff TLS, Authentifizierung, Reverse Proxy, VPN oder privates Netz planen statt einfach 0.0.0.0:11434 zu öffnen.

Befehl 1
ss -lntp | grep ':11434'
Befehl 2
docker ps --filter name='^/ollama$'
10
Fehlersuche

Connection refused, leere Modellliste und langsame CPU-Inferenz unterscheiden

Kann curl keine Verbindung aufbauen, zuerst Container und 127.0.0.1:11434-Binding prüfen. Liefert /api/tags HTTP 200, aber models ist leer, läuft die Runtime, möglicherweise ohne installiertes Modell.

Ist das Modell vorhanden, aber Chat schlägt fehl, docker logs ollama prüfen. Ist Chat nur langsam, mit ollama ps und docker stats CPU/RAM kontrollieren; CPU-only-Inferenz kann zusätzliche Ladezeit haben.

Befehl 1
docker ps --filter name='^/ollama$'
Befehl 2
curl -sS http://127.0.0.1:11434/api/tags
Befehl 3
docker logs --tail 150 ollama
Befehl 4
docker exec ollama ollama ps
docker stats --no-stream ollama
11
Schnellbefehle

Wichtige Ollama-API-curl- und Prüfkommandos an einem Ort sammeln

Modellliste und echte Chat-Anfrage sind die zwei schnellsten Integrationstests. Mit laufendem Modell, Containerlog und Socket-Prüfung lässt sich die fehlerhafte Schicht schnell eingrenzen.

Die folgenden Befehle fassen das Host- und Docker-Zugriffsmuster unseres realen Ubuntu-24.04-Tests zusammen.

Befehl 1
curl -sS http://127.0.0.1:11434/api/tags
Befehl 2
curl -sS http://127.0.0.1:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3:4b","messages":[{"role":"user","content":"Hallo"}],"stream":false}'
Befehl 3
docker exec ollama ollama ps
Befehl 4
ss -lntp | grep ':11434'
12
Wartung und Produktion

Modell-, Volume-, Log- und API-Health-Prüfungen zur Routine machen

Das Volume ollama_data hält Modelldateien unabhängig vom Container persistent. Vor Image-Updates oder Container-Neuerstellung eine Volume-Backup- und VPS-Snapshot-Strategie definieren.

Nach Reboot oder Upgrade Container, /api/tags, echte /api/chat-Anfrage und 11434-Binding erneut prüfen. So wird die reale Inferenzkette statt nur eines laufenden Prozesses validiert.

Befehl 1
docker ps --filter name='^/ollama$'
Befehl 2
curl -sS http://127.0.0.1:11434/api/tags
Befehl 3
docker exec ollama ollama list
Befehl 4
ss -lntp | grep ':11434'
Production checklist

Ollama-API-Sicherheitscheck für Produktion

Port 11434 nicht direkt auf 0.0.0.0 veröffentlichen.
Host-API auf 127.0.0.1 oder im privaten Netz halten.
Für Container-Integrationen benutzerdefiniertes Docker-Netz und Docker DNS verwenden.
Das Volume ollama_data sichern.
Modell- und API-Logs nach Updates prüfen.
CPU, RAM und Datenträger überwachen.
Für Remote-API TLS, Authentifizierung, VPN oder Reverse Proxy ergänzen.
Nach Reboot /api/tags und einen echten /api/chat-Test ausführen.
R
Offizielle Quellen

Offizielle Ollama-API- und Modellquellen

+
EKA Sunucu

Verwandte EKA-Sunucu-Ollama-, Open-WebUI- und n8n-Ratgeber

?
FAQ

Häufige Fragen zu Ollama API, curl und qwen3:4b

Welchen Port nutzt die Ollama API?

Im realen Setup wurde die Host-API unter 127.0.0.1:11434 verwendet.

Wofür dient /api/tags?

Wir nutzten den Endpunkt zum JSON-Listing installierter Modelle und zur schnellen Runtime-Prüfung.

Was bedeutet ein leeres models-Array?

Unser erster Test lieferte HTTP 200 plus models:[]: Runtime aktiv, aber noch kein Modell installiert.

Wie teste ich /api/chat?

JSON mit model, messages und stream:false per curl an /api/chat senden.

Welche Antwort lieferte qwen3:4b?

Der reale assistant content war EKA-OLLAMA-TEST-BASARILI.

Warum stream:false?

Damit erhielten wir im Test eine einzelne JSON-Antwort, die sich leicht prüfen ließ.

Wie lautet die Host-API-Adresse?

In dieser Architektur http://127.0.0.1:11434.

Welche Adresse nutzt ein anderer Docker-Container?

Im Netzwerk eka-ai verwendeten wir http://ollama:11434.

Warum funktioniert localhost in einem anderen Container nicht?

localhost bezeichnet den jeweiligen Container; für Ollama den Docker-DNS-Namen verwenden.

Wie groß war qwen3:4b?

Die reale ollama-list-Ausgabe zeigte ungefähr 2,5 GB.

Wie viel RAM nutzte die Inferenz?

Zum aufgenommenen Testzeitpunkt etwa 3.059 GiB für den Ollama-Container.

Soll Port 11434 öffentlich sein?

In dieser Anleitung nicht; er blieb auf 127.0.0.1. Für Remotezugriff zusätzliche Schutzschichten nutzen.

Was prüfen, wenn Chat langsam ist?

ollama ps und docker stats für CPU/RAM prüfen. CPU-only-Inferenz kann je nach Modell und Kontext langsamer sein.

Was nach einem Reboot testen?

Container, /api/tags, echte /api/chat-Anfrage, Modellliste und Loopback-Binding erneut prüfen.

EKA YAZILIM VE BİLİŞİM SİSTEMLERİ

Linux VPS für Ollama API und lokale LLM-Dienste gesucht?

Ollama, Qwen3, Open WebUI, n8n und weitere Self-Hosted-AI-Dienste auf einem eigenen EKA-Sunucu-Linux-VPS betreiben.

Aktualisiert: 10.08.2026
Linux-VPS-Pakete ansehenLinux- & VPS-Ratgeber
Top