Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

₺ Türkische Lira $ US Dollar € Euro
X
X

Wählen Sie Ihre Währung

₺ Türkische Lira $ US Dollar € Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
TECHNISCHER LEITFADEN • TR / EN / DE

OpenHands + Ollama / vLLM Local-Model-Setup

OpenHands mit lokaler/self-hosted Inference über Ollama oder vLLM verbinden und Modellwahl, Endpoint-Erreichbarkeit, Kontext sowie GPU-Kapazität planen.

Wichtiger Hinweis für Produktion

Vor Befehlen in der Produktion Versionen, Backups, Firewall-Regeln und Rollback-Plan in der eigenen Infrastruktur prüfen.

Architektur Kapazität Sicherheit Fehlerdiagnose
ARCHITEKTUR & DIAGNOSE
EKA CORE
OpenHands + Ollama / vLLM Local-Model-Setup

Architektur und DatenflussProduktionsorientierte technische Prüfung
Geprüft
Wie der Server dimensioniert wirdProduktionsorientierte technische Prüfung
Geprüft
Wie Performance gemessen wirdProduktionsorientierte technische Prüfung
Geprüft
Sicherheits- und ZugriffsgrenzenProduktionsorientierte technische Prüfung
Geprüft
Offizielle Quellen + messbarer Test + Rollback-Plan
Was dieser Leitfaden abdeckt

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

01

Was dieser Leitfaden abdeckt

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt.

✓Architektur und Datenfluss
✓Wie der Server dimensioniert wird
✓Wie Performance gemessen wird
✓Sicherheits- und Zugriffsgrenzen
✓Produktionsreife und Go-live
✓Fehlerdiagnose: wo beginnen?

Inhalt

  1. Architektur und Datenfluss
  2. Wie der Server dimensioniert wird
  3. Wie Performance gemessen wird
  4. Sicherheits- und Zugriffsgrenzen
  5. Produktionsreife und Go-live
  6. Fehlerdiagnose: wo beginnen?
  7. Häufige Fehler und Fehldiagnosen
  8. Befehle und Prüfausgaben
  9. Interaktives technisches Werkzeug
  10. Häufig gestellte Fragen
02

Architektur und Datenfluss

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen.

Das Design von OpenHands + Ollama / vLLM Local-Model-Setup nicht allein freigeben, weil alle Dienste starten. Inference-Endpunkt privat halten und Zugriff mit API-Key, Firewall und Runtime-Egress-Policy begrenzen. Den realen Netzwerk- und Datenpfad vor Produktion mit der Dokumentation von OpenHands Local LLMs abgleichen.

03

Wie der Server dimensioniert wird

Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem. Kapazität deshalb mit repräsentativen Daten und paralleler Last auf OpenHands + Ollama / vLLM Local-Model-Setup testen; Idle-RAM allein ist keine Sizing-Entscheidung.

04

Wie Performance gemessen wird

Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen. Bei GPU-beschleunigten Workloads sind Benchmarks nur mit identischem Modell/Daten, Parallelität und Messfenster vergleichbar.

Für Vergleiche Modell/Daten, Parallelität und Messfenster identisch halten. Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem. Neben Durchsatz auch Fehlerrate und Peak-Ressourcen erfassen.

05

Sicherheits- und Zugriffsgrenzen

Inference-Endpunkt privat halten und Zugriff mit API-Key, Firewall und Runtime-Egress-Policy begrenzen.

Zugriffskontrolle für OpenHands + Ollama / vLLM Local-Model-Setup ist Teil der Architektur und kein nachträgliches Deployment-Detail. Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen. Nicht öffentlich benötigte DB-, Worker-, Runtime- oder Admin-Ports privat halten.

06

Produktionsreife und Go-live

Beim Modellwechsel Erfolgsrate, Latenz und Token-Nutzung auf demselben Task-Set vergleichen; einzelner Prompt reicht nicht.

Diese Operation kann als Release-Prüfpunkt dienen: curl http://127.0.0.1:11434/api/tags. Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem. Bei Fehlern den Rollback-Punkt prüfen, bevor der Release fortgesetzt wird.

07

Fehlerdiagnose: wo beginnen?

Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem.

Bei Störungen in OpenHands + Ollama / vLLM Local-Model-Setup zuerst den Zeitpunkt der letzten Änderung erfassen. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen. Danach Service-Logs, Dependency-Health und Netzwerkzugriff auf derselben Zeitachse korrelieren.

ERR

Häufige Fehler und Fehldiagnosen

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Symptom / ProblemMögliche EbeneErste Prüfung
Sandbox startet, Workspace ist aber nicht beschreibbarDass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem.Relevante Service-Logs, Dependency-Health und letzte Änderung auf einer Zeitachse korrelieren.
Agent erreicht den lokalen Modell-Endpoint nichtBei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.Peak-Ressourcen, Parallelität sowie Disk-/Netzwerkdruck im selben Testfenster messen.
Tool-Aufrufe liefern ungültiges JSON oder TimeoutsInference-Endpunkt privat halten und Zugriff mit API-Key, Firewall und Runtime-Egress-Policy begrenzen.Public/Private-Ports, Authentifizierung, TLS und Secret-Scope von außen nach innen prüfen.
GPU ist verfügbar, aber Task-Erfolg bleibt niedrigBeim Modellwechsel Erfolgsrate, Latenz und Token-Nutzung auf demselben Task-Set vergleichen; einzelner Prompt reicht nicht.Version, Config-Diff, persistente Daten und Rollback-Punkt gemeinsam kontrollieren.
FLOW

Umsetzungs- und Prüfablauf

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt.

1

Workspace-Grenze definieren

OpenHands mit lokaler/self-hosted Inference über Ollama oder vLLM verbinden und Modellwahl, Endpoint-Erreichbarkeit, Kontext sowie GPU-Kapazität planen.

2

Sandbox-Provider validieren

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen.

3

LLM-Endpoint separat testen

Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

4

Secrets und Network-Egress begrenzen

Inference-Endpunkt privat halten und Zugriff mit API-Key, Firewall und Runtime-Egress-Policy begrenzen.

5

Mit identischem Task-Set benchmarken

Beim Modellwechsel Erfolgsrate, Latenz und Token-Nutzung auf demselben Task-Set vergleichen; einzelner Prompt reicht nicht.

6

Ergebnis mit Logs und Artefakten prüfen

Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem.

CLI

Befehle und Prüfausgaben

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt.

Schritt 1
ollama list
Schritt 2
curl http://127.0.0.1:11434/api/tags
Schritt 3
curl http://127.0.0.1:8000/v1/models
Schritt 4
nvidia-smi
GPU

Interaktives technisches Werkzeug

Ungefähre VRAM-Planung für Modellgewichte

—Das Ergebnis ist eine Schätzung; Produktionsentscheidungen benötigen reale Messungen und Tests.
TECHNISCHE VORBEWERTUNG

Serverbedarf technisch gemeinsam bewerten

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Telefon & WhatsApp0850 307 34 58Im ersten Schritt keine Passwörter senden.
SRC

Offizielle und technische Quellen

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt.

EKA

Verwandte Eka-Sunucu-Seiten

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt.

FAQ

Häufig gestellte Fragen

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Nutzt OpenHands die GPU direkt?

Die Agent-Schicht ruft einen lokalen Provider-Endpunkt auf; die Runtime muss ihn über das Netz erreichen.

Wo liegt die Sicherheitsgrenze zwischen Sandbox und Host?

Inference-Endpunkt privat halten und Zugriff mit API-Key, Firewall und Runtime-Egress-Policy begrenzen.

Wie erreicht ein Container Ollama/vLLM?

Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Welche Local-Model-Klasse sollte getestet werden?

Beim Modellwechsel Erfolgsrate, Latenz und Token-Nutzung auf demselben Task-Set vergleichen; einzelner Prompt reicht nicht.

Welche Verzeichnisse sollten nicht gemountet werden?

Dass ein Container hostseitiges Ollama über localhost nicht erreicht, ist ein typisches Namespace-Problem.

Garantiert das interaktive Werkzeug auf dieser Seite die benötigte Kapazität?

Nein. Es liefert eine erste Planungsschätzung. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen. Die endgültige Entscheidung am realen Workload validieren.

EKA SUNUCU

Serverbedarf technisch gemeinsam bewerten

Neben Installationsbefehlen werden Architektur, Kapazität, Sicherheit, Fehlerdiagnose und Produktionsbetrieb als Gesamtprozess behandelt. Bei Coding-Agents sind Kontext und Tool-Use ebenso wichtig wie Modellqualität; VRAM und Token-Durchsatz gemeinsam messen.

Telefon & WhatsApp0850 307 34 58ekasunucu.com
Top