Arama Yap Mesaj Senden
Rückruf anfordern
+90
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro
X
X

Wählen Sie Ihre Währung

Türkische Lira $ US Dollar Euro

Kontaktieren Sie uns

Standort Halkali Merkez Viertel Fatih Str. Ozgur Apt. No. 46, Kucukcekmece, Istanbul, 34303, TR
EKA AI TOOLS

AI-Modell VRAM- und GPU-Rechner

Dieses Werkzeug multipliziert nicht nur Parameterzahl und Bitbreite. Modellgewichte, ungefähre GGUF-Bits-pro-Gewicht, KV-Cache, hybride Attention-Fenster, Runtime-Reserve und nutzbarer Hardwarespeicher werden getrennt betrachtet. Die Werte dienen der Kapazitätsplanung; Runtime, Treiber, Backend, Batch und konkrete Modelldatei können abweichen.

GGUFKV CacheQ4_K_MMulti-GPUTR · EN · DE
01

Rechner

Dies ist eine Planungsabschätzung; multimodale Projektoren, speculative decoding, parallele Nutzer, große Batches, CUDA Graphs und Runtime-Workspaces können zusätzlichen Speicher benötigen.

Modellgewichte
KV-Cache
Runtime-Reserve
Geschätzte Summe
Empfohlener sicherer Speicher
Kompatibilität
Geschätzte Downloadzeit · 100 Mbit/s
Geschätzte Downloadzeit · 1 Gbit/s
02

So wird gerechnet

WEIGHTS

Das Modellgewicht wird aus Parameterzahl × effektiven Bits-pro-Gewicht / 8 geschätzt. GGUF K-quants speichern einige Tensoren mit anderer Präzision; Q4_K_M entspricht daher nicht exakt 4,0 Bit.

KV CACHE

Für Standard-Transformer gilt näherungsweise: 2 × Layer × KV-Heads × Head-Dimension × Tokens × Bytes je KV-Element. GQA reduziert den Cache durch weniger KV-Heads.

HYBRID ATTENTION

Bei Local/Global-Attention wie Gemma 3 speichern lokale Layer nur das Fenster. Bei GatedDeltaNet- und Full-Attention-Hybriden wie Qwen3.8 wird der mit dem Kontext wachsende Full-Attention-KV-Anteil direkt berechnet; zusätzlicher GatedDeltaNet-Zustand wird konservativ in der Runtime-Reserve berücksichtigt.

03

Vordefinierte Modellprofile

ModelParameterArchitekturKontextKV-Profil
Qwen3 8B8.2B36 layer · GQA40K8 KV heads · 128 dim
Qwen3.8 27B27B64 layer · GatedDeltaNet + Full Attention262KEvery 4th layer full attention
Qwen2.5 / DeepSeek R1 Distill 32B32.5B64 layer · GQA32K+8 KV heads · 128 dim
Llama 3.3 70B70.6B80 layer · GQA128K8 KV heads · 128 dim
Gemma 3 27B27BLocal/Global Attention128KLocal window aware
Mistral Small 3.1 24B24BDense Transformer128KPlanning profile
DeepSeek V3 / R1 Full671BMoE + MLA128KRuntime-dependent estimate
04

Quantisierungsvergleich

05

GPU-Speichervergleich

06

Technische Hinweise

  • Die GGUF-Dateigröße wird nicht allein durch Parameterzahl und Quant-Label bestimmt; Vokabular, Embeddings, Output-Tensoren und gemischte Quantisierung beeinflussen die Größe.
  • Ollama, llama.cpp, LM Studio, vLLM, SGLang und Transformers können für dasselbe Modell unterschiedliche Runtime-Arbeitsbereiche verwenden.
  • Das Multi-GPU-Ergebnis ist eine Kapazitätsplanung. PCIe/NVLink-Topologie, Tensor Parallelism und Layer-Split bestimmen zusätzlich die Performance.
  • Multimodale Modelle können für Vision Encoder oder Projector zusätzlichen Speicher über diese Textmodell-Schätzung hinaus benötigen.
  • Bei langem Kontext sollten neben dem angegebenen Maximum auch Qualitäts- und Durchsatzeffekte berücksichtigt werden.
  • Bei Apple Unified Memory sollte eine größere Reserve für Betriebssystem und andere Anwendungen eingeplant werden.
07

Häufige Fragen

Warum ist Q4_K_M nicht exakt 4 Bit?

K-quants enthalten Block-Skalen und speichern ausgewählte Tensoren höher aufgelöst. Der Rechner nutzt für Q4_K_M ungefähr 4,85 Bits pro Gewicht.

Läuft ein 32B-Modell auf 24 GB VRAM?

Q4-Gewichte vieler 32B-Modelle liegen bereits nahe 20 GB. Context und Runtime-Reserve machen 24 GB häufig knapp; kürzerer Context oder CPU-Offload kann nötig sein.

Addiert sich VRAM bei zwei GPUs einfach?

Mit Tensor-/Model-Parallelismus oder Layer-Splitting steigt die Kapazität, jedoch behandeln nicht alle Runtimes mehrere GPUs als perfekten gemeinsamen Pool.

Wie sind Apple-Silicon-Ergebnisse zu verstehen?

Unified Memory wird von CPU und GPU gemeinsam genutzt. Der Rechner reserviert deshalb einen größeren Anteil für das System.

Warum erhöht Context den VRAM-Bedarf?

Bei autoregressiver Generierung werden Key/Value-Zustände vorheriger Tokens gespeichert. Bei Standard-Attention wächst der KV-Cache ungefähr linear mit dem Context.

Warum ist DeepSeek V3 ungenauer?

DeepSeek V3 verwendet Multi-Head Latent Attention statt eines Standard-KV-Layouts. Das Gewicht ist schätzbar, der Context-Speicher hängt stärker von Runtime und Implementierung ab.

Passt das Modell nicht in den lokalen Speicher?

Nach der VRAM-Schätzung kann eine GPU-Kapazität mit ausreichender Reserve gewählt werden. Lange Kontexte, Parallelität und große Batches brauchen zusätzlichen Spielraum.

GPU-Server ansehenKontakt
Top