Bu araç yalnızca parametre sayısını bit genişliğiyle çarpmaz. Model ağırlıkları, GGUF quantization için yaklaşık bits-per-weight değeri, standart attention kullanan modellerde KV cache, hibrit attention modellerinde pencere davranışı, runtime payı ve seçilen donanımın kullanılabilir belleğini ayrı ayrı değerlendirir. Sonuçlar planlama tahminidir; gerçek kullanım runtime, sürücü, backend, batch ve model dosyasına göre değişebilir.
Bu hesap bir kapasite planlama tahminidir; multimodal projector, speculative decoding, paralel kullanıcılar, büyük batch, CUDA graph ve runtime çalışma alanları ek bellek kullanabilir.
Model ağırlığı yaklaşık olarak toplam parametre sayısı × quantization bits-per-weight / 8 ile hesaplanır. GGUF K-quants bazı tensorleri farklı bit genişliklerinde tuttuğu için Q4_K_M gibi formatlar tam 4.0 bit değildir; araç bu yüzden yaklaşık efektif bpw kullanır.
Standart transformer attention için KV cache yaklaşık 2 × katman × KV head × head dimension × token sayısı × KV veri tipi baytı formülüne dayanır. GQA kullanan modellerde KV head sayısı attention head sayısından küçük olduğundan cache önemli ölçüde azalabilir.
Gemma 3 gibi local/global attention karışımı kullanan modellerde local katmanlar tüm context yerine pencere kadar cache tutar. Qwen3.8 gibi GatedDeltaNet + full-attention hibritlerinde context ile büyüyen full-attention KV bölümü doğrudan hesaplanır; GatedDeltaNet durum belleği ise runtime payında muhafazakar biçimde ele alınır.
| Model | Parametre | Mimari | Context | KV profili |
|---|---|---|---|---|
| Qwen3 8B | 8.2B | 36 layer · GQA | 40K | 8 KV heads · 128 dim |
| Qwen3.8 27B | 27B | 64 layer · GatedDeltaNet + Full Attention | 262K | Every 4th layer full attention |
| Qwen2.5 / DeepSeek R1 Distill 32B | 32.5B | 64 layer · GQA | 32K+ | 8 KV heads · 128 dim |
| Llama 3.3 70B | 70.6B | 80 layer · GQA | 128K | 8 KV heads · 128 dim |
| Gemma 3 27B | 27B | Local/Global Attention | 128K | Local window aware |
| Mistral Small 3.1 24B | 24B | Dense Transformer | 128K | Planning profile |
| DeepSeek V3 / R1 Full | 671B | MoE + MLA | 128K | Runtime-dependent estimate |
K-quants blok ölçekleri ve bazı tensorlerin daha yüksek hassasiyette tutulması nedeniyle dosya başına efektif bits-per-weight değeri 4 bitten yüksektir. Araç Q4_K_M için yaklaşık 4.85 bpw kullanır.
Q4 sınıfında model ağırlıkları çoğu 32B modelde 20 GB civarına yaklaşır. Context ve runtime belleği eklendiğinde 24 GB kart genellikle sınırda kalır; CPU offload veya daha kısa context gerekebilir.
Tensor/model parallel veya uygun layer split kullanıldığında toplam kapasite artabilir; fakat her runtime iki kartın belleğini kusursuz tek havuz gibi kullanmaz. Araç kapasite planlamasında toplamı gösterir ve güvenlik payı uygular.
Unified Memory CPU ve GPU tarafından ortak kullanılır. Bu nedenle sistemin tamamını modele ayırmak mümkün değildir. Araç Apple profillerinde daha yüksek sistem rezervi bırakır.
Autoregressive üretimde geçmiş tokenların key/value durumları cache içinde tutulur. Standart attention modellerinde KV cache context ile yaklaşık doğrusal büyür.
DeepSeek V3 Multi-Head Latent Attention gibi standart KV formülünden farklı bir mimari kullanır. Model ağırlığı hesaplanabilir, ancak context belleği runtime ve implementasyona daha bağımlıdır; bu nedenle araç konservatif planlama sonucu verir.
VRAM ihtiyacınızı hesapladıktan sonra uygun GPU sunucu kapasitesini seçebilirsiniz. Uzun context, çoklu kullanıcı ve yüksek batch için yalnızca modelin sığması değil, çalışma payının da yeterli olması gerekir.