Parametre ve precision’dan yaklaşık weight memory elde edilir.
Model dosyasının diskte 18 GB olması, 24 GB GPU’da her koşulda çalışacağı anlamına gelmez. Ağırlıklar dışında quantization overhead, runtime, KV cache, context ve eşzamanlı sequence’ler VRAM tüketir. Araç bu bileşenleri ayrı gösterir.
KV cache varsayılanı evrensel değildir. MHA/GQA yapısı, layer sayısı, KV head sayısı, head dimension, cache dtype ve serving motoru büyük fark yaratır. Araçta KV GB/1k token değerini kesin model hesabınıza göre değiştirin.
Basit ağırlık hesabı: parametre(B) × bit / 8 ≈ GB. Bu yalnız başlangıçtır. Araç ağırlığa format payı, runtime/headroom ve kullanıcı tarafından ayarlanabilir KV cache maliyeti ekler. Sonuç kapasite planı tahminidir; model config ve gerçek `nvidia-smi` ölçümüyle doğrulanmalıdır.
Basit ağırlık hesabı: parametre(B) × bit / 8 ≈ GB. Bu yalnız başlangıçtır. Araç ağırlığa format payı, runtime/headroom ve kullanıcı tarafından ayarlanabilir KV cache maliyeti ekler. Sonuç kapasite planı tahminidir; model config ve gerçek `nvidia-smi` ölçümüyle doğrulanmalıdır.
LLM için yaklaşık VRAM ihtiyacını ağırlık bit’i, parametre, context, KV cache ve concurrency ile hesaplayın. Formülü görün, headroom ekleyin ve GPU sınıfını tahmin edin.
Parametre ve precision’dan yaklaşık weight memory elde edilir.
Context ve eşzamanlı sequence arttıkça cache belleği büyür.
Araçta değiştirilebilir; runtime/fragmentation için kaba başlangıç payıdır.
Tahmini production kararı `nvidia-smi` peak ve load test ile doğrulayın.
Billion parametre × bit/parametre ÷ 8 kabaca decimal GB verir. Gerçek dosya ve VRAM kullanımı quant metadata, tensor packing ve runtime nedeniyle farklı olabilir.
| Örnek | Ham weight |
|---|---|
| 7B @ FP16 | ≈ 14 GB |
| 7B @ 8-bit | ≈ 7 GB |
| 7B @ 4-bit | ≈ 3.5 GB |
| 70B @ 4-bit | ≈ 35 GB |
Group scales, zero-points, codebooks ve tensor metadata efektif bit/parametreyi yükseltebilir. Bu nedenle araç ham weight üzerine küçük format payı ekler.
Decoder attention geçmiş token’ların key/value durumunu saklar. Bellek layer, KV head, head dimension, dtype, token count ve sequence sayısıyla yaklaşık doğrusal büyür.
Queue/batching motoru aynı anda kaç sequence’i GPU’da aktif tutuyorsa KV ve runtime belleği ona göre artar. 100 login olmuş kullanıcı 100 aktif sequence anlamına gelmeyebilir.
| Kavram | Anlam |
|---|---|
| Connected users | Sistemde bağlı kullanıcı |
| Queued requests | GPU sırasını bekleyen |
| Active sequences | GPU/KV kaynak tüketen aktif generation |
Temporary tensors, CUDA graphs/kernels, allocator fragmentation ve context spike beklenmedik OOM yaratabilir. Production’da ölçülen peak’in üzerinde güvenlik payı bırakın.
Tensor parallel modelin ağırlıklarını paylaşabilir ancak PCIe/NVLink communication throughput ve latency’yi etkiler. 2×24 GB ile tek 48 GB aynı serving profili değildir.
nvidia-smi topo -mnvidia-smi --query-gpu=name,memory.total,memory.used,temperature.gpu,power.draw --format=csvModeli gerçek serving motorunda target context/concurrency ile yükleyin; idle weights, warmup peak ve load-test peak değerlerini ayrı kaydedin.
| Aşama | Kaydet |
|---|---|
| Model load | Idle VRAM |
| Warmup | Kernel/graph peak |
| Max context | KV growth |
| Target concurrency | Peak + p95 latency |
Şeffaf tahmin: ağırlıklar + runtime payı + KV cache. Kesin model mimarisi için KV maliyetini ayarlayın.
Eka Sunucu GPU altyapısında hesapladığınız VRAM sınıfına göre 24/32/48/80+ GB seçeneklerini gerçek model, context ve concurrency ile benchmark edebilirsiniz.
Rehber hazırlanırken esas alınan birincil dokümantasyon ve teknik kaynaklar.
İlgili altyapı ve uygulama rehberleriyle devam edin.
LLM VRAM Hesaplayıcı
Ham ağırlık yaklaşık 35 GB’dır; format overhead, runtime ve KV cache eklendiğinde gerçek serving ihtiyacı daha yüksektir. Context/concurrency değerine göre araçla hesaplayın.
Ham ağırlık yaklaşık 16 GB civarıdır; birçok formatta çalışması mümkün olabilir fakat uzun context/concurrency ve runtime headroom sonucu belirler. Exact model ile test gerekir.
KV cache maliyeti model architecture’a göre ciddi değişir. Evrensel sabit kullanmak sahte kesinlik yaratır; model config’ten hesaplanan değeri girebilmeniz için alan açıktır.
Hayır. Model ancak serving motoru multi-GPU sharding’i destekliyorsa bölünebilir; interconnect ve tensor parallel overhead performansı etkiler.