Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
TEKNİK REHBER • TR / EN / DE

Langfuse + LiteLLM + vLLM Gözlemleme Sistemi

OpenAI uyumlu vLLM servislerini LiteLLM gateway üzerinden yönlendirip Langfuse ile trace, latency, hata ve kullanım görünürlüğü kazandıran self-hosted mimari.

Production öncesi önemli not

Komutları canlı sistemde uygulamadan önce sürüm, yedek, firewall ve geri dönüş planını kendi altyapınızda doğrulayın.

mimari kapasite güvenlik hata teşhisi
MİMARİ & TEŞHİS
EKA CORE
Langfuse + LiteLLM + vLLM Gözlemleme Sistemi

Mimari ve veri akışıProduction odaklı teknik kontrol
Doğrulandı
Sunucu kapasitesi nasıl planlanmalı?Production odaklı teknik kontrol
Doğrulandı
Performans nasıl ölçülmeli?Production odaklı teknik kontrol
Doğrulandı
Güvenlik ve erişim sınırlarıProduction odaklı teknik kontrol
Doğrulandı
Resmî kaynak + ölçülebilir test + geri dönüş planı
Bu rehberde neler var?

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

01

Bu rehberde neler var?

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.

Mimari ve veri akışı
Sunucu kapasitesi nasıl planlanmalı?
Performans nasıl ölçülmeli?
Güvenlik ve erişim sınırları
Production kontrolü ve canlıya geçiş
Hata teşhisi: nereden başlanmalı?
Yedekleme, güncelleme ve işletim
Hangi senaryoda mantıklı?

İçindekiler

  1. Mimari ve veri akışı
  2. Sunucu kapasitesi nasıl planlanmalı?
  3. Performans nasıl ölçülmeli?
  4. Güvenlik ve erişim sınırları
  5. Production kontrolü ve canlıya geçiş
  6. Hata teşhisi: nereden başlanmalı?
  7. Yedekleme, güncelleme ve işletim
  8. Hangi senaryoda mantıklı?
  9. Sık görülen hata ve yanlış teşhisler
  10. Komutlar ve kontrol çıktıları
  11. Sık sorulan sorular
02

Mimari ve veri akışı

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır.

Langfuse + LiteLLM + vLLM Gözlemleme Sistemi için tasarım kararı yalnız servislerin ayağa kalkmasına göre verilmemeli. API key gateway’de merkezileştirilmeli, vLLM backend public internete doğrudan açılmamalı ve telemetry erişimi rol bazlı sınırlandırılmalıdır. Mimari doğrulamada Langfuse GitHub dokümantasyonu ile gerçek ağ ve veri akışı birlikte karşılaştırılmalıdır.

03

Sunucu kapasitesi nasıl planlanmalı?

Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır. Bu yüzden kapasite testi, Langfuse + LiteLLM + vLLM Gözlemleme Sistemi üzerinde gerçek veri ve eşzamanlı iş yüküyle yapılmalı; yalnız boşta kullanılan RAM değeri satın alma kararına dönüştürülmemelidir.

04

Performans nasıl ölçülmeli?

Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir. GPU veya hızlandırıcı kullanılan senaryoda aynı model/veri, aynı concurrency ve aynı ölçüm süresi korunmadan yapılan karşılaştırma güvenilir değildir.

Karşılaştırmada aynı veri/model, aynı concurrency ve aynı ölçüm penceresi korunur. 502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır. Sonuç tablosuna throughput yanında başarısız iş oranı ve peak kaynak kullanımı da eklenmelidir.

05

Güvenlik ve erişim sınırları

API key gateway’de merkezileştirilmeli, vLLM backend public internete doğrudan açılmamalı ve telemetry erişimi rol bazlı sınırlandırılmalıdır.

Langfuse + LiteLLM + vLLM Gözlemleme Sistemi için erişim politikası deployment sonrasında eklenen bir ayrıntı değildir. İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır. Bu akışta public olması gerekmeyen database, worker, runtime veya yönetim portları private ağda tutulmalıdır.

06

Production kontrolü ve canlıya geçiş

Health check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir.

Canlıya geçiş kontrolünde şu komut/işlem hattı da doğrulama noktası olarak kullanılabilir: docker compose ps. 502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır. Bu kontrol başarısızsa release ilerletilmeden önce geri dönüş noktası test edilmelidir.

07

Hata teşhisi: nereden başlanmalı?

502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır.

Langfuse + LiteLLM + vLLM Gözlemleme Sistemi arızasında semptom ile kök nedeni ayırmak için önce son değişiklik zamanı kaydedilir. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir. Ardından servis logu, dependency health ve ağ erişimi aynı zaman diliminde karşılaştırılır.

08

Yedekleme, güncelleme ve işletim

Health check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir.

Health check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir. İşletim runbook’unda config, kalıcı veri, secret envanteri ve restore sırası ayrı tutulmalı; Langfuse GitHub sürüm notları yükseltme öncesinde kontrol edilmelidir.

09

Hangi senaryoda mantıklı?

OpenAI uyumlu vLLM servislerini LiteLLM gateway üzerinden yönlendirip Langfuse ile trace, latency, hata ve kullanım görünürlüğü kazandıran self-hosted mimari.

Langfuse + LiteLLM + vLLM Gözlemleme Sistemi seçimi, yalnız ürünün popülerliğine göre değil şu hedefe göre yapılmalıdır: OpenAI uyumlu vLLM servislerini LiteLLM gateway üzerinden yönlendirip Langfuse ile trace, latency, hata ve kullanım görünürlüğü kazandıran self-hosted mimari. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir. Bu iki koşul karşılanmıyorsa daha küçük bir PoC ile başlanması daha güvenlidir.

ERR

Sık görülen hata ve yanlış teşhisler

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

Belirti / problemMuhtemel katmanİlk doğrulama
Trace geliyor ancak panelde görünmüyor502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır.İlgili servis logu, dependency health ve son değişiklik zamanı tek zaman çizgisinde karşılaştırılır.
ClickHouse yazma kuyruğu gecikiyorGateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.Peak kaynak kullanımı, concurrency ve disk/network baskısı aynı test penceresinde ölçülür.
Worker olayları işleyemiyorAPI key gateway’de merkezileştirilmeli, vLLM backend public internete doğrudan açılmamalı ve telemetry erişimi rol bazlı sınırlandırılmalıdır.Public/private portlar, kimlik doğrulama, TLS ve secret kapsamı dıştan içe doğrulanır.
Retention sonrası disk büyümeye devam ediyorHealth check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir.Sürüm, config diff, kalıcı veri ve geri dönüş noktası birlikte kontrol edilir.
FLOW

Uygulama ve doğrulama akışı

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.

1

Trace kaynağını doğrula

OpenAI uyumlu vLLM servislerini LiteLLM gateway üzerinden yönlendirip Langfuse ile trace, latency, hata ve kullanım görünürlüğü kazandıran self-hosted mimari.

2

Web ve worker katmanını ayır

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır.

3

PostgreSQL/ClickHouse sağlığını ölç

Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

4

Redis/Valkey politikasını kontrol et

API key gateway’de merkezileştirilmeli, vLLM backend public internete doğrudan açılmamalı ve telemetry erişimi rol bazlı sınırlandırılmalıdır.

5

Retention ve backup planını uygula

Health check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir.

6

SDK’den uçtan uca test gönder

502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır.

CLI

Komutlar ve kontrol çıktıları

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.

Adım 1
curl -s http://127.0.0.1:8000/v1/models
Adım 2
nvidia-smi
Adım 3
docker compose ps
Adım 4
ss -tulpn
TEKNİK ÖN DEĞERLENDİRME

Sunucu ihtiyacınızı teknik olarak değerlendirelim

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

Telefon & WhatsApp0850 307 34 58İlk aşamada şifre göndermeyin.
SRC

Resmî ve teknik kaynaklar

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.

EKA

İlgili Eka Sunucu sayfaları

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz.

FAQ

Sık sorulan sorular

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

Langfuse için ClickHouse neden önemlidir?

İstemci yalnız gateway’i görür; LiteLLM routing/policy uygular, vLLM inference üretir, Langfuse bağımsız gözlemleme katmanı olarak kalır.

Web ve worker aynı sunucuda olabilir mi?

API key gateway’de merkezileştirilmeli, vLLM backend public internete doğrudan açılmamalı ve telemetry erişimi rol bazlı sınırlandırılmalıdır.

Trace retention nasıl planlanmalı?

Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

Redis/Valkey eviction neden risklidir?

Health check, timeout, retry ve fallback gerçek yük altında test edilmeden production kararı verilmemelidir.

LLM maliyet takibi gerçek faturayla aynı mıdır?

502/504 zincirinde gateway timeout artırmadan önce her hop için ayrı log ve latency ölçümü yapılmalıdır.

Production’da hangi bileşenler yedeklenmeli?

OpenAI uyumlu vLLM servislerini LiteLLM gateway üzerinden yönlendirip Langfuse ile trace, latency, hata ve kullanım görünürlüğü kazandıran self-hosted mimari. Langfuse Self-hosting

EKA SUNUCU

Sunucu ihtiyacınızı teknik olarak değerlendirelim

Kurulum komutundan öte mimari, kapasite, güvenlik, hata teşhisi ve production işletimini tek akışta ele alıyoruz. Gateway CPU/RAM, vLLM GPU/VRAM, Langfuse ise analitik storage I/O açısından farklı kaynak profillerine sahiptir.

Telefon & WhatsApp0850 307 34 58ekasunucu.com
Top