Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

₺ Türkische Lira $ US Dollar € Euro
X
X

Wählen Sie Ihre Währung

₺ Türkische Lira $ US Dollar € Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
TECHNISCHER LEITFADEN • TR / EN / DE

Ubuntu 24.04: Production-RAG mit Qdrant + Ollama + n8n

Produktionsorientierte Einrichtung von n8n, Ollama und Qdrant auf Ubuntu 24.04 LTS mit persistentem Storage, Container-Netzwerk, Embedding-Kompatibilität, GPU-Planung und Recovery.

Wichtiger Hinweis für Produktion

Vor Befehlen in der Produktion Versionen, Backups, Firewall-Regeln und Rollback-Plan in der eigenen Infrastruktur prüfen.

Ubuntu 24.04 LTS Qdrant Vector Store Ollama Local LLM n8n RAG Workflow
ARCHITEKTUR & DIAGNOSE
EKA CORE
Ubuntu 24.04 Qdrant + Ollama + n8n RAG

n8n orchestriert Workflows, Ollama bedient Chat- und Embedding-Modelle, Qdrant übernimmt Vector Retrieval. Häufige Fehler entstehen durch Netzwerkadressen, Dimensionskonflikte, Ressourcenengpässe oder ungeschützte Dienste.

RAG-Architektur und DatenflussProduktionsorientierte technische Prüfung
Geprüft
CPU/RAM/VRAM/NVMe-SizingProduktionsorientierte technische Prüfung
Geprüft
Docker- und Service-NetzwerkProduktionsorientierte technische Prüfung
Geprüft
Embedding- und Collection-DesignProduktionsorientierte technische Prüfung
Geprüft
Offizielle Quellen + messbare Tests + Rollback-Plan
Was dieser Leitfaden abdeckt

Ein zuverlässiger RAG-Stack besteht nicht nur aus laufenden Containern. Embeddings müssen kompatibel sein, Qdrant-Dimensionen zum Modell passen, n8n muss Dienste über das Docker-Netz erreichen und wichtige Daten benötigen persistente Volumes.

01

Was dieser Leitfaden abdeckt

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

✓RAG-Architektur und Datenfluss
✓CPU/RAM/VRAM/NVMe-Sizing
✓Docker- und Service-Netzwerk
✓Embedding- und Collection-Design
✓n8n Ingest und Retrieval
✓Sicherheit, TLS und Secrets
✓Backup und Diagnose
✓Production-Benchmark

Inhalt

  1. RAG-Architektur und Datenfluss
  2. CPU, RAM, VRAM und NVMe dimensionieren
  3. Docker-Netzwerk und localhost-Falle
  4. Embedding, Chunks und Qdrant Collections
  5. Ingest und Frage-Antwort trennen
  6. Production-Sicherheit
  7. Backup, Updates und Rollback
  8. RAG richtig benchmarken
  9. Komponenten- und Netzwerkmatrix
  10. Vorabschätzung für Vector Storage
  11. Häufige RAG-Fehler
  12. Befehle und Deployment-Blöcke
  13. Häufig gestellte Fragen
02

RAG-Architektur und Datenfluss

Dokumente werden bereinigt und in Chunks geteilt, als Embeddings in Qdrant gespeichert und bei einer Anfrage über denselben Embedding-Raum wiedergefunden. n8n übergibt den gefundenen Kontext an das Ollama-Chatmodell.

Retrieval und Generierung getrennt bewerten: Eine flüssige Antwort beweist kein korrektes Retrieval. Relevanz, Antwortqualität und Latenz separat messen.

03

CPU, RAM, VRAM und NVMe dimensionieren

Ollama hängt von Modellgröße, Kontext und GPU-Offload ab. Qdrant wird durch Vektoranzahl, Dimensionen, Payload-Indizes, Quantisierung, Replikation und Storage bestimmt.

Größerer Kontext erhöht den Speicherbedarf. Reale Promptgrößen und Parallelität testen; schnelles SSD/NVMe hilft bei Ingest, Snapshots und großen Collections.

04

Docker-Netzwerk und localhost-Falle

Im n8n-Container zeigt localhost auf n8n selbst. Dienste im Compose-Netz werden über Servicenamen wie http://ollama:11434 und http://qdrant:6333 angesprochen.

Qdrant und Ollama möglichst privat halten. Externe Endpunkte mit Reverse Proxy, TLS, Authentifizierung und Netzrestriktionen absichern.

05

Embedding, Chunks und Qdrant Collections

Die Qdrant-Vektordimension muss zur Embedding-Ausgabe passen. Bei Modellwechsel sind neue Collection und Re-Embedding oft sauberer als gemischte Vektoren.

Chunking mit echten Fragen prüfen; semantische Grenzen und Metadaten erhalten, statt nur eine fixe Zeichenzahl zu verwenden.

06

Ingest und Frage-Antwort trennen

Ein Workflow übernimmt Laden, Bereinigen, Chunking, Embedding und Qdrant-Upsert; ein zweiter Workflow Frage-Embedding, Retrieval, Prompt-Aufbau und Ollama.

Dokumente nicht bei jeder Frage neu embedden. n8n-Ausführungen, Qdrant-Queries und Modell-Latenz gemeinsam korrelieren.

07

Production-Sicherheit

Self-hosted Qdrant benötigt explizite API Keys, eingeschränktes Binding und TLS. Standardkonfiguration nicht ungeprüft ins Internet stellen.

n8n Encryption Key zusammen mit DB-Backups schützen und Ollama nur für notwendige Services erreichbar machen.

08

Backup, Updates und Rollback

Container-Images sind keine Datenbackups. Qdrant Storage/Snapshots, n8n-Datenbank und Encryption Key gemeinsam sichern.

Image-Versionen dokumentieren, Updates in Staging testen und Embedding-Modellwechsel als Datenmigration behandeln.

09

RAG richtig benchmarken

TTFT, End-to-End-Latenz, Qdrant-p95, Embedding-Zeit, Retrieval-Relevanz, Kontextgröße, GPU/CPU und Fehlerquote gemeinsam messen.

Beim Vergleich dieselben Fragen, denselben Collection-Snapshot und dieselben Modelleinstellungen verwenden; `ollama ps` für Offload und Kontext prüfen.

MAP

Komponenten- und Netzwerkmatrix

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

KomponenteAufgabeNetz / PortProduktionshinweis
n8nWorkflow-Orchestrierung5678 hinter Proxy/privatEncryption Key und DB schützen
OllamaChat- und Embedding-Inferenz11434 privatModell, VRAM, Kontext prüfen
QdrantVector Retrieval6333/6334 privatAPI Key, Binding, TLS, Snapshots
PostgreSQLPersistente n8n-Daten5432 internBackups und Storage Monitoring
Reverse ProxyHTTPS-Einstieg80/443 öffentlichTLS, Rate Limits, Timeouts
CALC

Vorabschätzung für Vector Storage

Das Ergebnis ist eine Schätzung; Produktionsentscheidungen benötigen reale Messungen und Tests.

ERR

Häufige RAG-Fehler

Ein zuverlässiger RAG-Stack besteht nicht nur aus laufenden Containern. Embeddings müssen kompatibel sein, Qdrant-Dimensionen zum Modell passen, n8n muss Dienste über das Docker-Netz erreichen und wichtige Daten benötigen persistente Volumes.

Symptom / ProblemMögliche EbeneErste Prüfung
n8n erreicht Ollama nichtContainer-Netzwerk / localhosthttp://ollama:11434 im Compose-Netz testen.
Qdrant meldet Dimension ErrorEmbedding/Collection ungleichEmbedding-Dimension mit Collection vergleichen.
Falsche Quellen im RAGChunking/Embedding/RetrievalTop-k mit echten Fragen manuell prüfen.
Ollama nutzt CPU trotz GPURuntime/Offload`nvidia-smi` und `ollama ps` prüfen.
Daten nach Qdrant-Neustart wegVolume fehlt/falschStorage-Mount und Snapshots prüfen.
n8n Credentials nach Migration defektEncryption Key stimmt nichtPassenden Key und DB-Backup gemeinsam wiederherstellen.
FLOW

Installations- und Prüfablauf

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

1

Ubuntu und Docker prüfen

Updates, Docker Compose und ggf. GPU Runtime validieren.

2

Dienste privat starten

Service-Namen und interne Erreichbarkeit prüfen.

3

Embedding-Design fixieren

Modell, Dimension, Distance und Chunking dokumentieren.

4

Ingest-Workflow bauen

Quelle → Chunk → Embedding → Qdrant.

5

Retrieval/Chat bauen

Frage → Embedding → Qdrant → Kontext → Ollama.

6

Sicherheit und Backup

Ports reduzieren, TLS/API Keys und Restore-Test.

7

Lasttest

p95, Retrieval-Qualität und Ressourcen unter Last messen.

CLI

Befehle und Deployment-Blöcke

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

Docker und Compose prüfen
docker --version && docker compose version
Offizielles n8n AI Starter Kit
git clone https://github.com/n8n-io/self-hosted-ai-starter-kit.git
cd self-hosted-ai-starter-kit
cp .env.example .env
CPU-Profil starten
docker compose --profile cpu pull
docker compose --profile cpu up -d
NVIDIA-GPU-Profil
nvidia-smi
docker compose --profile gpu-nvidia pull
docker compose --profile gpu-nvidia up -d
Service-Checks
docker compose ps
curl -fsS http://127.0.0.1:6333/
curl -fsS http://127.0.0.1:11434/api/tags
Ollama Modell/Kontext
ollama list
ollama ps
Log-Diagnose
docker compose logs --tail=150 n8n qdrant
docker compose logs --tail=150 ollama-cpu ollama-gpu 2>/dev/null || true
TECHNISCHE VORBEWERTUNG

RAG-Server technisch planen

Modellgröße, Datenmenge, Parallelität, GPU-Wunsch und Ziel-Latenz reichen für eine technische Vorplanung von CPU/RAM/VRAM/NVMe und Service-Trennung.

Telefon & WhatsApp0850 307 34 58Im ersten Schritt keine Passwörter oder API-Schlüssel senden.
SRC

Offizielle und technische Quellen

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

EKA

Verwandte Eka-Sunucu-Seiten

Architektur, Sizing, Docker-Netzwerk, Embeddings, Sicherheit, Performance, Backup und Fehlerdiagnose bis zur Produktion.

FAQ

Häufig gestellte Fragen

Ein zuverlässiger RAG-Stack besteht nicht nur aus laufenden Containern. Embeddings müssen kompatibel sein, Qdrant-Dimensionen zum Modell passen, n8n muss Dienste über das Docker-Netz erreichen und wichtige Daten benötigen persistente Volumes.

Können n8n, Ollama und Qdrant auf einem Server laufen?

Ja, sofern CPU, RAM, VRAM und Storage unter realer Last ausreichend sind.

Soll Port 6333 öffentlich sein?

Meist nicht. Qdrant im privaten Netz halten und bei externem Zugriff TLS, Auth und Netzrestriktionen nutzen.

Embedding-Modell wechseln ohne Re-Embedding?

Meist nicht sinnvoll; anderer Embedding-Raum oder Dimension verlangt eine neue Collection.

Ist GPU Pflicht?

Für n8n und Qdrant nein; für Ollama hängt es von Modell, Latenz und Parallelität ab.

Ist das n8n AI Starter Kit direkt Production-ready?

Es ist ein starker PoC/Lern-Startpunkt; HA, Security, Backup und Monitoring müssen für Produktion ergänzt werden.

Qdrant live auf NFS/S3?

Qdrant fordert für persistenten Live-Storage block-level POSIX-kompatiblen Storage statt NFS/Object Storage.

Warum verbraucht größerer Kontext mehr VRAM?

Mehr Kontext erhöht den Runtime-Speicherbedarf. Reale Zuweisung mit `ollama ps` prüfen.

Wie RAG-Qualität messen?

Mit echten Fragen Retrieval-Evidenz, Antwortkorrektheit und Latenz gemeinsam bewerten.

EKA SUNUCU

RAG-Server technisch planen

Modellgröße, Datenmenge, Parallelität, GPU-Wunsch und Ziel-Latenz reichen für eine technische Vorplanung von CPU/RAM/VRAM/NVMe und Service-Trennung.

Telefon & WhatsApp0850 307 34 58ekasunucu.com
Top