Dieses Werkzeug multipliziert nicht nur Parameterzahl und Bitbreite. Modellgewichte, ungefähre GGUF-Bits-pro-Gewicht, KV-Cache, hybride Attention-Fenster, Runtime-Reserve und nutzbarer Hardwarespeicher werden getrennt betrachtet. Die Werte dienen der Kapazitätsplanung; Runtime, Treiber, Backend, Batch und konkrete Modelldatei können abweichen.
Dies ist eine Planungsabschätzung; multimodale Projektoren, speculative decoding, parallele Nutzer, große Batches, CUDA Graphs und Runtime-Workspaces können zusätzlichen Speicher benötigen.
Das Modellgewicht wird aus Parameterzahl × effektiven Bits-pro-Gewicht / 8 geschätzt. GGUF K-quants speichern einige Tensoren mit anderer Präzision; Q4_K_M entspricht daher nicht exakt 4,0 Bit.
Für Standard-Transformer gilt näherungsweise: 2 × Layer × KV-Heads × Head-Dimension × Tokens × Bytes je KV-Element. GQA reduziert den Cache durch weniger KV-Heads.
Bei Local/Global-Attention wie Gemma 3 speichern lokale Layer nur das Fenster. Bei GatedDeltaNet- und Full-Attention-Hybriden wie Qwen3.8 wird der mit dem Kontext wachsende Full-Attention-KV-Anteil direkt berechnet; zusätzlicher GatedDeltaNet-Zustand wird konservativ in der Runtime-Reserve berücksichtigt.
| Model | Parameter | Architektur | Kontext | KV-Profil |
|---|---|---|---|---|
| Qwen3 8B | 8.2B | 36 layer · GQA | 40K | 8 KV heads · 128 dim |
| Qwen3.8 27B | 27B | 64 layer · GatedDeltaNet + Full Attention | 262K | Every 4th layer full attention |
| Qwen2.5 / DeepSeek R1 Distill 32B | 32.5B | 64 layer · GQA | 32K+ | 8 KV heads · 128 dim |
| Llama 3.3 70B | 70.6B | 80 layer · GQA | 128K | 8 KV heads · 128 dim |
| Gemma 3 27B | 27B | Local/Global Attention | 128K | Local window aware |
| Mistral Small 3.1 24B | 24B | Dense Transformer | 128K | Planning profile |
| DeepSeek V3 / R1 Full | 671B | MoE + MLA | 128K | Runtime-dependent estimate |
K-quants enthalten Block-Skalen und speichern ausgewählte Tensoren höher aufgelöst. Der Rechner nutzt für Q4_K_M ungefähr 4,85 Bits pro Gewicht.
Q4-Gewichte vieler 32B-Modelle liegen bereits nahe 20 GB. Context und Runtime-Reserve machen 24 GB häufig knapp; kürzerer Context oder CPU-Offload kann nötig sein.
Mit Tensor-/Model-Parallelismus oder Layer-Splitting steigt die Kapazität, jedoch behandeln nicht alle Runtimes mehrere GPUs als perfekten gemeinsamen Pool.
Unified Memory wird von CPU und GPU gemeinsam genutzt. Der Rechner reserviert deshalb einen größeren Anteil für das System.
Bei autoregressiver Generierung werden Key/Value-Zustände vorheriger Tokens gespeichert. Bei Standard-Attention wächst der KV-Cache ungefähr linear mit dem Context.
DeepSeek V3 verwendet Multi-Head Latent Attention statt eines Standard-KV-Layouts. Das Gewicht ist schätzbar, der Context-Speicher hängt stärker von Runtime und Implementierung ab.
Nach der VRAM-Schätzung kann eine GPU-Kapazität mit ausreichender Reserve gewählt werden. Lange Kontexte, Parallelität und große Batches brauchen zusätzlichen Spielraum.