70B Q4 örneği
Salt 4-bit ağırlık teorik olarak yaklaşık 32,6 GiB sınıfındadır; runtime ve KV cache eklenmeden GPU seçilmemelidir.
Parametre sayısı, ağırlık bit genişliği, context, eşzamanlı istek ve KV cache yapısıyla LLM için yaklaşık VRAM ihtiyacını hesaplayın.
$ model: parameters + quantization $ memory = weights + KV cache + runtime $ context x concurrency => KV growth $ output: safe VRAM target
Ağırlıkların kapladığı VRAM yalnızca başlangıçtır. Uzun context, çoklu eşzamanlı istek, KV cache, runtime workspace ve model mimarisi toplam belleği büyütür. Bu araç ağırlık + KV cache + runtime payını ayrı gösterir.
Bu araç kapasite planlaması için başlangıç tahmini üretir; üretim kararı yük testi ve gerçek izleme verileriyle doğrulanmalıdır.
Değerleri değiştirip tekrar hesaplayın.
Temel yaklaşım parametre sayısı × bit/8 değeridir. Dosya formatı, quantization metadata'sı, tensor hizalama ve runtime kopyaları nedeniyle gerçek kullanım bundan yüksek olabilir.
Salt 4-bit ağırlık teorik olarak yaklaşık 32,6 GiB sınıfındadır; runtime ve KV cache eklenmeden GPU seçilmemelidir.
Parametre başına yaklaşık 2 byte ağırlık belleği gerekir; eğitimde optimizer ve gradient belleği çok daha fazladır.
Decoder-only transformer için kaba KV formülü 2 × layer × KV-head × head-dim × context × concurrency × byte/element olarak düşünülebilir. GQA/MQA kullanan modellerde KV head sayısı attention head sayısından farklı olabilir.
İki GPU'nun belleği ancak framework/model paralelliği bunu destekliyorsa birlikte kullanılabilir. 2×24 GB, her durumda tek 48 GB GPU gibi davranmaz.
Model yükleniyor olsa bile peak generation, batch, CUDA graph, kernel workspace ve başka süreçler OOM oluşturabilir. Üretimde %10–25 veya ölçüme dayalı daha yüksek headroom kullanın.
Ağırlıkların hedef bit genişliği yaklaşık 4 bittir; quantization grup ölçekleri ve metadata nedeniyle dosya ve VRAM kullanımı tam teorik değerden sapabilir.
KV cache mimariye ve concurrency'ye bağlı olarak context ile yaklaşık doğrusal büyür. Uzun context ve çoklu kullanıcı VRAM'i hızla artırabilir.
Hayır. Eğitim/LoRA/QLoRA için activations, gradients, optimizer states ve batch belleği ayrıca hesaplanmalıdır.
Bazı runtime'lar katmanları CPU/RAM'e offload edebilir; GPU ihtiyacını azaltabilir fakat gecikme ve throughput etkilenir.
İş yükünüzü, trafik profilinizi ve büyüme hedefinizi iletin; uygun VPS veya GPU sunucu sınıfını netleştirelim.