Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
Son teknik kontrol · 17.08.2026 · LLM VRAM Hesaplayıcı

LLM VRAM Hesaplayıcı: “Model Kaç GB?” Sorusunu Serving Bütçesine Çevirin

Model dosyasının diskte 18 GB olması, 24 GB GPU’da her koşulda çalışacağı anlamına gelmez. Ağırlıklar dışında quantization overhead, runtime, KV cache, context ve eşzamanlı sequence’ler VRAM tüketir. Araç bu bileşenleri ayrı gösterir.

Üretim notu

KV cache varsayılanı evrensel değildir. MHA/GQA yapısı, layer sayısı, KV head sayısı, head dimension, cache dtype ve serving motoru büyük fark yaratır. Araçta KV GB/1k token değerini kesin model hesabınıza göre değiştirin.

vram hesaplayıcı llmllm kaç gb vram70b model vram
TEKNİK UYGULAMA PROFİLİ
EKA CORE
LLM VRAM Hesaplayıcı

Basit ağırlık hesabı: parametre(B) × bit / 8 ≈ GB. Bu yalnız başlangıçtır. Araç ağırlığa format payı, runtime/headroom ve kullanıcı tarafından ayarlanabilir KV cache maliyeti ekler. Sonuç kapasite planı tahminidir; model config ve gerçek `nvidia-smi` ölçümüyle doğrulanmalıdır.

P×bits/8Ağırlık başlangıcı
Kontrol
KVContext maliyeti
Kontrol
20%Varsayılan headroom
Kontrol
PeakGerçek doğrulama
Kontrol
Teknik rehber · production odaklı · resmî kaynaklar
Kısa cevap

Basit ağırlık hesabı: parametre(B) × bit / 8 ≈ GB. Bu yalnız başlangıçtır. Araç ağırlığa format payı, runtime/headroom ve kullanıcı tarafından ayarlanabilir KV cache maliyeti ekler. Sonuç kapasite planı tahminidir; model config ve gerçek `nvidia-smi` ölçümüyle doğrulanmalıdır.

01

Teknik kapsam ve önemli noktalar

LLM için yaklaşık VRAM ihtiyacını ağırlık bit’i, parametre, context, KV cache ve concurrency ile hesaplayın. Formülü görün, headroom ekleyin ve GPU sınıfını tahmin edin.

P×bits/8Ağırlık başlangıcı

Parametre ve precision’dan yaklaşık weight memory elde edilir.

KVContext maliyeti

Context ve eşzamanlı sequence arttıkça cache belleği büyür.

20%Varsayılan headroom

Araçta değiştirilebilir; runtime/fragmentation için kaba başlangıç payıdır.

PeakGerçek doğrulama

Tahmini production kararı `nvidia-smi` peak ve load test ile doğrulayın.

Bu sayfada

  1. 1. Model ağırlık belleği nasıl hesaplanır?
  2. 2. 4-bit demek tam olarak 4.000 bit/parametre değildir
  3. 3. KV cache neden context ile büyür?
  4. 4. Eşzamanlı kullanıcı ile sequence aynı şey değildir
  5. 5. VRAM’i %100 doldurmak neden riskli?
  6. 6. Tek karta sığmayan model için yalnız VRAM toplamayın
  7. 7. Hesap sonucu nasıl doğrulanır?
  8. Sık sorulan sorular
02

1. Model ağırlık belleği nasıl hesaplanır?

Billion parametre × bit/parametre ÷ 8 kabaca decimal GB verir. Gerçek dosya ve VRAM kullanımı quant metadata, tensor packing ve runtime nedeniyle farklı olabilir.

ÖrnekHam weight
7B @ FP16≈ 14 GB
7B @ 8-bit≈ 7 GB
7B @ 4-bit≈ 3.5 GB
70B @ 4-bit≈ 35 GB
03

2. 4-bit demek tam olarak 4.000 bit/parametre değildir

Group scales, zero-points, codebooks ve tensor metadata efektif bit/parametreyi yükseltebilir. Bu nedenle araç ham weight üzerine küçük format payı ekler.

GGUF Q4_K_M, GPTQ, AWQ, bitsandbytes 4-bit aynı format değildir.
Aynı “4-bit” etiketi farklı kernel ve serving motorunda farklı performans verir.
04

3. KV cache neden context ile büyür?

Decoder attention geçmiş token’ların key/value durumunu saklar. Bellek layer, KV head, head dimension, dtype, token count ve sequence sayısıyla yaklaşık doğrusal büyür.

GQA daha az KV head ile MHA’ya göre cache maliyetini azaltabilir.
FP8/quantized KV cache destekleyen motorlarda cache dtype maliyeti değişebilir.
Context 8k→32k dört kat token demektir; diğer faktörler sabitse KV bileşeni yaklaşık dört kat büyüyebilir.
05

4. Eşzamanlı kullanıcı ile sequence aynı şey değildir

Queue/batching motoru aynı anda kaç sequence’i GPU’da aktif tutuyorsa KV ve runtime belleği ona göre artar. 100 login olmuş kullanıcı 100 aktif sequence anlamına gelmeyebilir.

KavramAnlam
Connected usersSistemde bağlı kullanıcı
Queued requestsGPU sırasını bekleyen
Active sequencesGPU/KV kaynak tüketen aktif generation
06

5. VRAM’i %100 doldurmak neden riskli?

Temporary tensors, CUDA graphs/kernels, allocator fragmentation ve context spike beklenmedik OOM yaratabilir. Production’da ölçülen peak’in üzerinde güvenlik payı bırakın.

Warmup sonrası peak VRAM ölçün.
En uzun izin verilen context ile test edin.
Concurrency saturation testinde OOM yerine queue/backpressure hedefleyin.
07

6. Tek karta sığmayan model için yalnız VRAM toplamayın

Tensor parallel modelin ağırlıklarını paylaşabilir ancak PCIe/NVLink communication throughput ve latency’yi etkiler. 2×24 GB ile tek 48 GB aynı serving profili değildir.

Komut
nvidia-smi topo -m
Komut
nvidia-smi --query-gpu=name,memory.total,memory.used,temperature.gpu,power.draw --format=csv
08

7. Hesap sonucu nasıl doğrulanır?

Modeli gerçek serving motorunda target context/concurrency ile yükleyin; idle weights, warmup peak ve load-test peak değerlerini ayrı kaydedin.

AşamaKaydet
Model loadIdle VRAM
WarmupKernel/graph peak
Max contextKV growth
Target concurrencyPeak + p95 latency
VRAM

İnteraktif araç: LLM bellek tahmin aracı

Şeffaf tahmin: ağırlıklar + runtime payı + KV cache. Kesin model mimarisi için KV maliyetini ayarlayın.

Ağırlık
KV cache
Tahmini toplam
Önerilen sınıf

EKA SUNUCU · TECHNICAL

Tahmini VRAM’den sonra gerçek modelle GPU staging testi yapın

Eka Sunucu GPU altyapısında hesapladığınız VRAM sınıfına göre 24/32/48/80+ GB seçeneklerini gerçek model, context ve concurrency ile benchmark edebilirsiniz.

Production ilkesiÖlç → Test Et → Canlıya AlUydurma benchmark verisi kullanılmaz.
SRC

Resmî kaynaklar

Rehber hazırlanırken esas alınan birincil dokümantasyon ve teknik kaynaklar.

EKA

İlgili teknik içerikler

İlgili altyapı ve uygulama rehberleriyle devam edin.

FAQ

Sık sorulan sorular

LLM VRAM Hesaplayıcı

70B 4-bit model kaç GB VRAM ister?

Ham ağırlık yaklaşık 35 GB’dır; format overhead, runtime ve KV cache eklendiğinde gerçek serving ihtiyacı daha yüksektir. Context/concurrency değerine göre araçla hesaplayın.

24 GB GPU’da 32B 4-bit çalışır mı?

Ham ağırlık yaklaşık 16 GB civarıdır; birçok formatta çalışması mümkün olabilir fakat uzun context/concurrency ve runtime headroom sonucu belirler. Exact model ile test gerekir.

KV GB/1k token değeri neden manuel?

KV cache maliyeti model architecture’a göre ciddi değişir. Evrensel sabit kullanmak sahte kesinlik yaratır; model config’ten hesaplanan değeri girebilmeniz için alan açıktır.

İki 24 GB GPU toplam 48 GB gibi mi?

Hayır. Model ancak serving motoru multi-GPU sharding’i destekliyorsa bölünebilir; interconnect ve tensor parallel overhead performansı etkiler.

Top