Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR

AI / LLM VRAM Hesaplayıcı

Parametre sayısı, ağırlık bit genişliği, context, eşzamanlı istek ve KV cache yapısıyla LLM için yaklaşık VRAM ihtiyacını hesaplayın.

$ model: parameters + quantization
$ memory = weights + KV cache + runtime
$ context x concurrency => KV growth
$ output: safe VRAM target
Kısa karar

Ağırlıkların kapladığı VRAM yalnızca başlangıçtır. Uzun context, çoklu eşzamanlı istek, KV cache, runtime workspace ve model mimarisi toplam belleği büyütür. Bu araç ağırlık + KV cache + runtime payını ayrı gösterir.

Hesaplayıcı

Bu araç kapasite planlaması için başlangıç tahmini üretir; üretim kararı yük testi ve gerçek izleme verileriyle doğrulanmalıdır.

Hesap sonucu

Ağırlık VRAM
KV cache
Runtime payı
Toplam tahmin
Güvenli hedef
GPU bellek sınıfı
Öneri

Değerleri değiştirip tekrar hesaplayın.

Ağırlık belleği nasıl hesaplanır?

Temel yaklaşım parametre sayısı × bit/8 değeridir. Dosya formatı, quantization metadata'sı, tensor hizalama ve runtime kopyaları nedeniyle gerçek kullanım bundan yüksek olabilir.

70B Q4 örneği

Salt 4-bit ağırlık teorik olarak yaklaşık 32,6 GiB sınıfındadır; runtime ve KV cache eklenmeden GPU seçilmemelidir.

FP16/BF16

Parametre başına yaklaşık 2 byte ağırlık belleği gerekir; eğitimde optimizer ve gradient belleği çok daha fazladır.

KV cache neden büyür?

Decoder-only transformer için kaba KV formülü 2 × layer × KV-head × head-dim × context × concurrency × byte/element olarak düşünülebilir. GQA/MQA kullanan modellerde KV head sayısı attention head sayısından farklı olabilir.

Tek GPU kapasitesi ile toplam VRAM aynı şey değildir

İki GPU'nun belleği ancak framework/model paralelliği bunu destekliyorsa birlikte kullanılabilir. 2×24 GB, her durumda tek 48 GB GPU gibi davranmaz.

Sunucuda güvenlik payı bırakın

Model yükleniyor olsa bile peak generation, batch, CUDA graph, kernel workspace ve başka süreçler OOM oluşturabilir. Üretimde %10–25 veya ölçüme dayalı daha yüksek headroom kullanın.

Resmî teknik kaynaklar

Sık sorulan sorular

Q4 tam olarak 4 bit mi kullanır?

Ağırlıkların hedef bit genişliği yaklaşık 4 bittir; quantization grup ölçekleri ve metadata nedeniyle dosya ve VRAM kullanımı tam teorik değerden sapabilir.

Context VRAM'i ne kadar etkiler?

KV cache mimariye ve concurrency'ye bağlı olarak context ile yaklaşık doğrusal büyür. Uzun context ve çoklu kullanıcı VRAM'i hızla artırabilir.

Fine-tuning için bu hesap yeterli mi?

Hayır. Eğitim/LoRA/QLoRA için activations, gradients, optimizer states ve batch belleği ayrıca hesaplanmalıdır.

CPU offload kullanabilir miyim?

Bazı runtime'lar katmanları CPU/RAM'e offload edebilir; GPU ihtiyacını azaltabilir fakat gecikme ve throughput etkilenir.

Uygun altyapıyı birlikte boyutlandıralım

İş yükünüzü, trafik profilinizi ve büyüme hedefinizi iletin; uygun VPS veya GPU sunucu sınıfını netleştirelim.

Sunucu seçenekleriİletişim
Top