Arama Yap Mesaj Gönder
Biz Sizi Arayalım
+90
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro
X

Lütfen Ülke (Bölge) Seçiniz

Türkiye (Türkçe)Türkiye (Türkçe) Almanya (German)Almanya (German) Worldwide (English)Worldwide (English)
X

Lütfen Para Birimi Seçiniz

Türk Lirası $ US Dollar Euro

Bize Ulaşın

Konum Halkalı merkez mahallesi fatih cd ozgur apt no 46 , Küçükçekmece , İstanbul , 34303 , TR
EKA AI TOOLS

AI Model VRAM ve GPU Hesaplayıcı

Bu araç yalnızca parametre sayısını bit genişliğiyle çarpmaz. Model ağırlıkları, GGUF quantization için yaklaşık bits-per-weight değeri, standart attention kullanan modellerde KV cache, hibrit attention modellerinde pencere davranışı, runtime payı ve seçilen donanımın kullanılabilir belleğini ayrı ayrı değerlendirir. Sonuçlar planlama tahminidir; gerçek kullanım runtime, sürücü, backend, batch ve model dosyasına göre değişebilir.

GGUFKV CacheQ4_K_MMulti-GPUTR · EN · DE
01

Hesaplama Aracı

Bu hesap bir kapasite planlama tahminidir; multimodal projector, speculative decoding, paralel kullanıcılar, büyük batch, CUDA graph ve runtime çalışma alanları ek bellek kullanabilir.

Model ağırlıkları
KV cache
Runtime payı
Tahmini toplam
Önerilen güvenli bellek
Uyumluluk
Tahmini model dosyası indirme süresi · 100 Mbps
Tahmini model dosyası indirme süresi · 1 Gbps
02

Nasıl Hesaplanıyor?

WEIGHTS

Model ağırlığı yaklaşık olarak toplam parametre sayısı × quantization bits-per-weight / 8 ile hesaplanır. GGUF K-quants bazı tensorleri farklı bit genişliklerinde tuttuğu için Q4_K_M gibi formatlar tam 4.0 bit değildir; araç bu yüzden yaklaşık efektif bpw kullanır.

KV CACHE

Standart transformer attention için KV cache yaklaşık 2 × katman × KV head × head dimension × token sayısı × KV veri tipi baytı formülüne dayanır. GQA kullanan modellerde KV head sayısı attention head sayısından küçük olduğundan cache önemli ölçüde azalabilir.

HYBRID ATTENTION

Gemma 3 gibi local/global attention karışımı kullanan modellerde local katmanlar tüm context yerine pencere kadar cache tutar. Qwen3.8 gibi GatedDeltaNet + full-attention hibritlerinde context ile büyüyen full-attention KV bölümü doğrudan hesaplanır; GatedDeltaNet durum belleği ise runtime payında muhafazakar biçimde ele alınır.

03

Hazır Model Profilleri

ModelParametreMimariContextKV profili
Qwen3 8B8.2B36 layer · GQA40K8 KV heads · 128 dim
Qwen3.8 27B27B64 layer · GatedDeltaNet + Full Attention262KEvery 4th layer full attention
Qwen2.5 / DeepSeek R1 Distill 32B32.5B64 layer · GQA32K+8 KV heads · 128 dim
Llama 3.3 70B70.6B80 layer · GQA128K8 KV heads · 128 dim
Gemma 3 27B27BLocal/Global Attention128KLocal window aware
Mistral Small 3.1 24B24BDense Transformer128KPlanning profile
DeepSeek V3 / R1 Full671BMoE + MLA128KRuntime-dependent estimate
04

Quantization Karşılaştırması

05

GPU Bellek Karşılaştırması

06

Doğru Sonuç İçin Teknik Notlar

  • GGUF dosya boyutu yalnızca toplam parametre ve quant etiketiyle birebir belirlenmez; vocabulary, embedding, output tensor ve quant karışımı sonucu değiştirebilir.
  • Ollama, llama.cpp, LM Studio, vLLM, SGLang ve Transformers aynı modelde farklı runtime çalışma alanı kullanabilir.
  • Çoklu GPU sonucu kapasite planlamasıdır. PCIe/NVLink topolojisi, tensor parallel ve layer split performansı ayrıca belirler.
  • Multimodal modellerde vision encoder/projector bellek ihtiyacı bu temel metin modeli hesabına ek yük getirebilir.
  • Uzun context seçerken yalnızca modelin ilan edilen maksimum context değerine değil, kalite ve throughput etkisine de bakılmalıdır.
  • Apple Unified Memory profillerinde sistem ve diğer uygulamalar için daha yüksek rezerv bırakılması önerilir.
07

Sık Sorulan Sorular

Q4_K_M neden tam 4 bit olarak hesaplanmıyor?

K-quants blok ölçekleri ve bazı tensorlerin daha yüksek hassasiyette tutulması nedeniyle dosya başına efektif bits-per-weight değeri 4 bitten yüksektir. Araç Q4_K_M için yaklaşık 4.85 bpw kullanır.

24 GB VRAM ile 32B model çalışır mı?

Q4 sınıfında model ağırlıkları çoğu 32B modelde 20 GB civarına yaklaşır. Context ve runtime belleği eklendiğinde 24 GB kart genellikle sınırda kalır; CPU offload veya daha kısa context gerekebilir.

İki GPU varsa VRAM doğrudan toplanır mı?

Tensor/model parallel veya uygun layer split kullanıldığında toplam kapasite artabilir; fakat her runtime iki kartın belleğini kusursuz tek havuz gibi kullanmaz. Araç kapasite planlamasında toplamı gösterir ve güvenlik payı uygular.

Apple Silicon için sonuç nasıl yorumlanmalı?

Unified Memory CPU ve GPU tarafından ortak kullanılır. Bu nedenle sistemin tamamını modele ayırmak mümkün değildir. Araç Apple profillerinde daha yüksek sistem rezervi bırakır.

Context neden VRAM kullanımını artırıyor?

Autoregressive üretimde geçmiş tokenların key/value durumları cache içinde tutulur. Standart attention modellerinde KV cache context ile yaklaşık doğrusal büyür.

DeepSeek V3 neden daha belirsiz gösteriliyor?

DeepSeek V3 Multi-Head Latent Attention gibi standart KV formülünden farklı bir mimari kullanır. Model ağırlığı hesaplanabilir, ancak context belleği runtime ve implementasyona daha bağımlıdır; bu nedenle araç konservatif planlama sonucu verir.

Modeliniz Yerel Donanıma Sığmıyor mu?

VRAM ihtiyacınızı hesapladıktan sonra uygun GPU sunucu kapasitesini seçebilirsiniz. Uzun context, çoklu kullanıcı ve yüksek batch için yalnızca modelin sığması değil, çalışma payının da yeterli olması gerekir.

GPU Sunucuları İnceleİletişim
Top